{"as_of":"2026-08-08T11:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68fa63030100bed1d733d0454ae9e88c102613e942dbed7cda8609936268aafd","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:49:32.643541Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:49:27.503557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T00:14:04.018407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-08-07T14:49:27.503557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.503557Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:35c7704125caf2cddb6daef18af4c2a1747ff3b0b6cb3c0f769ba1829fcc8b23","observation_id":"118b8495-b3c1-4f18-bd1f-c222269dc67c","resolution":{"observed_at":"2026-08-07T14:49:27.503557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T09:26:00.413651Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2604.27393"},"observation_digest":"sha256:2556e22b678319ab4731ffa83fd639ac2a3b5f3c448e0e3b5fea0be3362bf58e","observation_id":"d6210e1b-6a83-4c2d-9e58-ada4cd421369","resolution":{"observed_at":"2026-05-12T09:46:26.402755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:e93fe2bd680e94640b5098ea66a705be86a4d41ec85032ea5e808b0d50d8c590","observation_id":"aeef7706-ab4b-484f-9876-d8ad5fd3fa6f","resolution":{"observed_at":"2026-05-11T19:46:15.312622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:374668c9b6d99561dd09acfce3aabbcf2d2d716edc377dda2e8b5da24ad458aa","observation_id":"7290fc7b-e18b-48a8-bfde-b4bc33641c02","resolution":{"observed_at":"2026-05-11T00:50:49.572777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2505.17496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-06-30T00:14:04.018407Z","title":"Analyzing mitigation strategies for catastrophic forgetting in end-to-end training of spoken language models","venue":null,"work_id":"a135e24e-433c-4cfa-a30c-c86b972f75f3","year":2025},"citing_paper":{"arxiv_id":"2605.24863","last_updated":"2026-05-29T01:13:17Z","snapshot_observed_at":"2026-08-07T19:58:36.942630Z","submitted_at":"2026-05-24T04:46:30Z","title":"Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T00:13:50.278588Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2605.24863"},"observation_digest":"sha256:10279900012fc6fc0606b1b41f6260813e8e0bc89c4357b038dc974beacb0864","observation_id":"22bf6741-a9d7-4308-909d-fd4c133a05d0","resolution":{"observed_at":"2026-06-30T00:14:04.020962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17496/citation-record","integrity":"/paper/2505.17496/integrity","json":"/paper/2505.17496/citation-record.json","paper":"/paper/2505.17496"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17496","snapshot_observed_at":"2026-08-07T14:49:27.503557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.503557Z"},"links":{"cited_paper":"/paper/2505.17496","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:35c7704125caf2cddb6daef18af4c2a1747ff3b0b6cb3c0f769ba1829fcc8b23","observation_id":"118b8495-b3c1-4f18-bd1f-c222269dc67c","resolution":{"observed_at":"2026-08-07T14:49:27.503557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.697475Z","title":null,"venue":null,"work_id":"aa7ee43d-7f0e-4c03-afa8-d18269f1242b","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.620949Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:25b4afc598c3e670474ed04a327138070682db45805664b0656d5af05ff9e62c","observation_id":"ae861de5-1056-44e4-b436-7cd7074e9a60","resolution":{"observed_at":"2026-08-07T14:49:37.739818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.539896Z","title":"model merging after experience replay","venue":null,"work_id":"9b154ecd-f387-4581-a1e3-e22b940f1428","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.701968Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:369d083bb7ed2e5903d2c9cff7669396cfe00ba17af489f041f1a202d334cc2a","observation_id":"3a4a6fe1-047a-490c-9b91-f6b26c8daab2","resolution":{"observed_at":"2026-08-07T14:49:37.616001Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.344743Z","title":"Catastrophic forgetting Fig.3 shows the evaluation results on instruction-following and question answering in each training stage on T2T setting","venue":null,"work_id":"5971db4d-49c3-4605-bba1-728849493dbd","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.785987Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:40b369eadbd547a00d55f24edb6ebb8f263b5c3971140a02d8e6864d8100fa30","observation_id":"3dfc9cbe-9d1e-4b87-a101-f2505f0c55f7","resolution":{"observed_at":"2026-08-07T14:49:37.430359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.216453Z","title":"The results demonstrate that expe- rience replay is the most effective method, with further perfor- mance gains achievable by combining it with other techniques","venue":null,"work_id":"f2833ce9-3d39-48bf-9a01-bbfa371df610","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.891143Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:fe30fd6036e2e3fc6f493aad359f93ae94cd9d82509f50baa81eebd2c9d93049","observation_id":"06ceb650-210d-490b-8cc9-dec78f6770b1","resolution":{"observed_at":"2026-08-07T14:49:37.269287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:49:27.974838Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:27.974838Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:3a0a435a7a89e104b9629da6361480289d5c2772abc9a07b697e8b0947cb3c17","observation_id":"3797e6e1-9d33-4a8e-9552-408c0b578a29","resolution":{"observed_at":"2026-08-07T14:49:27.974838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:49:28.073588Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.073588Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:851ea0652dfcc4d0a29663dfd163a90a082552b2c42342c1569ca02db8bef171","observation_id":"0baea6ba-f3f0-4bd4-be3e-eae0565a93b6","resolution":{"observed_at":"2026-08-07T14:49:28.073588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:49:28.203129Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.203129Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:8817a9f8c4ec8e4334b74280cefc80f673ee2e140f4f8100de2e8c831af8f30f","observation_id":"bc749462-ff52-481e-a87a-7a3623d4b8bb","resolution":{"observed_at":"2026-08-07T14:49:28.203129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:49:28.267095Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.267095Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:9dfa15b140594f68d4a4a353f2eaa8129e16f4015e66716f7b0c903169f1551a","observation_id":"a31ed582-f950-460f-9364-343267f7fd3c","resolution":{"observed_at":"2026-08-07T14:49:28.267095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:37.082995Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"18590f5f-d672-4f9d-a0ac-e1334ac27d97","year":2021},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.357983Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:329986eb5b42bea5a64ae719210f0d776bbc6d47482bd64f4ee332d2a1e3aed6","observation_id":"419642c6-4c42-42d6-89a6-d65afa5ac256","resolution":{"observed_at":"2026-08-07T14:49:37.124544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.921707Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"e383ad22-d150-4628-b8b9-9279237ea019","year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.439186Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:9585e18f674177dc385aff42579f4d3090f2a6f651a046ee9e35e6a9ea5bcc54","observation_id":"0c42895f-bbe2-4f2f-b426-65a259956dfc","resolution":{"observed_at":"2026-08-07T14:49:36.990638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T14:49:28.537697Z","title":"Seamless: Multilingual expressive and stream- ing speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.537697Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:978945ebf71d51bed6ff2d546214727682aabf74ffc1498dc8a78a8bd15ac2fe","observation_id":"f9c63014-3cb0-48d8-8af5-6f85d8fdbb59","resolution":{"observed_at":"2026-08-07T14:49:28.537697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05361","last_updated":"2025-06-09T16:36:12Z","snapshot_observed_at":"2026-07-06T19:47:16.854192Z","submitted_at":"2024-11-08T06:33:22Z","title":"Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05361","snapshot_observed_at":"2026-08-07T14:49:28.620577Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.620577Z"},"links":{"cited_paper":"/paper/2411.05361","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:a04571423b7b3cb449e7c49f2612c9bf63c27e979842250d5743ec5470519472","observation_id":"6e3323cd-c372-4bd9-8862-80d0d81e1159","resolution":{"observed_at":"2026-08-07T14:49:28.620577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.723505Z","title":"Dynamic-superb: Towards a dynamic, col- laborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"232a36d7-2d34-4b66-96a8-6e9d470d8d3d","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.704201Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:11a9e32310bdec906f2483d61dd8c50f09c4f7fbb469242e614e817b44506afd","observation_id":"a0569789-654b-4876-974a-748e520e66aa","resolution":{"observed_at":"2026-08-07T14:49:36.817565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-07T14:49:28.778868Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.778868Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:89eb8c6cca670f0720bdc5183942dba59764a82d9cc0018128efcd3f92a43ed5","observation_id":"f138d9a8-3898-4499-998b-906c899ce561","resolution":{"observed_at":"2026-08-07T14:49:28.778868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.506762Z","title":"UniverSLU: Universal spoken language under- standing for diverse tasks with natural language instructions,","venue":null,"work_id":"e38af2bf-e08c-40d0-8e7e-8ad4eea7afb5","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.883748Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:b11fb7340e4effe31b1e80b470a2b1b2bb5ed92937e747a78077e2dba9e75180","observation_id":"7f4e7bcb-fd9c-4989-96f3-539928d79ccd","resolution":{"observed_at":"2026-08-07T14:49:36.618209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.340680Z","title":"ESPnet-SpeechLM: An open speech language model toolkit,","venue":null,"work_id":"07cefb6d-8745-4168-95cf-eae888a98043","year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:28.988718Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:ebefc7f1a850e0c547b16c284f8d2a1d8b1967753981dfd51a418a15b8bea38c","observation_id":"30d8664d-fa11-4dfb-9095-ce0d551ce349","resolution":{"observed_at":"2026-08-07T14:49:36.428957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:36.089223Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"fd98fcb1-df8c-45c1-915f-bb06bc7524fc","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.090373Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:b6c0a174142e7398208ba35be8096d6461f827826701e59a9c29e4bea1d804d6","observation_id":"9848b011-631c-4159-a246-b1354fd81a78","resolution":{"observed_at":"2026-08-07T14:49:36.222228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.879156Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"7a79f123-249c-41a8-b12a-fcbe49a6ecf3","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.173184Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:61e1846925090ce339f0ecc3fb597800b5c07ff00daf73820aad395e65ff2223","observation_id":"620f5420-a1b9-4267-99c9-541345a9fe36","resolution":{"observed_at":"2026-08-07T14:49:36.005034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.765377Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"f34a87af-a7c1-4d82-8278-b8fe4a105ba7","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.257897Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:203cbdc5c0c1651919ad943260af8ed02c8fba681ce7564be6b14d4d79f8fe81","observation_id":"dbbceda6-52d2-4195-9d57-3d7cc9659bc2","resolution":{"observed_at":"2026-08-07T14:49:35.806551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20007","last_updated":"2025-01-27T08:46:09Z","snapshot_observed_at":"2026-08-05T02:18:00.592980Z","submitted_at":"2024-09-30T07:01:21Z","title":"DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20007","snapshot_observed_at":"2026-08-07T14:49:29.352657Z","title":"Developing instruction- following speech language model without speech instruction- tuning data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.352657Z"},"links":{"cited_paper":"/paper/2409.20007","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:956cc9ff194bcfd751d1702b210e528b53dd09356373373ad711bf566b39be16","observation_id":"0279a263-cbd1-4f53-baf0-7984b7ea1c83","resolution":{"observed_at":"2026-08-07T14:49:29.352657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:49:29.431423Z","title":"Qwen-audio: Advancing universal audio under- standing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.431423Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:327dae14efb6355e1678da5c346753159f96eeaaa3f2a946f49842dcffac8b86","observation_id":"c2f4d02f-e771-47cd-b34c-1624906e9d27","resolution":{"observed_at":"2026-08-07T14:49:29.431423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T14:49:29.530299Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.530299Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:8770ed875433187812cbbcc7fb1c585d4182888b99a193d912ff439ff4a75c67","observation_id":"64118d62-9c24-4235-9d94-d07d1e2d7cf8","resolution":{"observed_at":"2026-08-07T14:49:29.530299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.653698Z","title":"SpeechGPT: Empowering large language mod- els with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"bce1696e-03ba-430c-98e3-c5730795e537","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.616584Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:7791df2e85e27b2fc0a66e421c4bcbf95b572cb84bc890bb4bd926915885a22a","observation_id":"fb46d111-c5cb-4e3e-b5f2-c2dcd445e741","resolution":{"observed_at":"2026-08-07T14:49:35.693307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.547968Z","title":"Audiolm: A language modeling approach to au- dio generation,","venue":null,"work_id":"ab3ab371-2a4c-4df8-9348-731c76fd2a98","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.669080Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:61978c212010764ce2bd39f44a2e41560639b3e7ff20dae5ee6192e50a88511b","observation_id":"57cc660e-5096-4383-a1bb-daec940cb195","resolution":{"observed_at":"2026-08-07T14:49:35.583710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:49:29.740906Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.740906Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:3d8c8e759e973a0370a9cca476033377cce9c428b9c37dbcd64a63a543150026","observation_id":"2472925a-b332-4cff-a7f4-cec303d410ee","resolution":{"observed_at":"2026-08-07T14:49:29.740906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:49:29.836731Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.836731Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:ff8bf2a48a1e83511688eb1799d41af5e9277a8108dada922babbab61bfa10ab","observation_id":"99f94a9b-b0ba-4851-9d93-67f50709eca7","resolution":{"observed_at":"2026-08-07T14:49:29.836731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T14:49:29.942638Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:29.942638Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:0814bcf6d7bb7b57e870b2609702d4c70f62de39e34622baa478dd0e077747f1","observation_id":"a92c2aa1-99ea-4f6b-8ef0-909ed81a58a6","resolution":{"observed_at":"2026-08-07T14:49:29.942638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07111","last_updated":"2024-12-27T07:29:19Z","snapshot_observed_at":"2026-07-06T19:48:32.368124Z","submitted_at":"2024-11-11T16:37:40Z","title":"Building a Taiwanese Mandarin Spoken Language Model: A First Attempt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07111","snapshot_observed_at":"2026-08-07T14:49:30.027800Z","title":"Building a taiwanese mandarin spoken lan- guage model: A first attempt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.027800Z"},"links":{"cited_paper":"/paper/2411.07111","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:1afc2004dc02f427fe225e8c55a4bed53eea0fa2273d38723d037c8fe1dae0fb","observation_id":"1767e8f5-1977-445a-90b2-13ef00464690","resolution":{"observed_at":"2026-08-07T14:49:30.027800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6211","last_updated":"2015-03-04T01:43:31Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T06:31:41Z","title":"An Empirical Investigation of Catastrophic Forgetting in Gradient-Based Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6211","snapshot_observed_at":"2026-08-07T14:49:30.102903Z","title":"An empirical investigation of catastrophic forgetting in gradient-based neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.102903Z"},"links":{"cited_paper":"/paper/1312.6211","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:feab7a5f644022899693df7c68d8079a30a9f4653cbe5b13d665fad67be8414e","observation_id":"df2d0df4-04e0-46a9-90aa-89df1497546e","resolution":{"observed_at":"2026-08-07T14:49:30.102903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-07T14:49:30.202377Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.202377Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:6bad787b1274019afd3f4ecfc463d1992d08a1d734874fc58ae2146a95e175ee","observation_id":"069b8776-e893-4f6b-8e5e-ae8d0aa49acd","resolution":{"observed_at":"2026-08-07T14:49:30.202377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.399661Z","title":"Mitigating the alignment tax of rlhf,","venue":null,"work_id":"ef965461-c570-4b8b-b71f-58e91acd9a5b","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.359211Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:dbfa5328fa7f497c88c7cea1b553b44a9528a4f333c3c65e6d439738c6361b62","observation_id":"c53032a3-6cc2-4fa3-99a0-a600906fa832","resolution":{"observed_at":"2026-08-07T14:49:35.464670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.273584Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"0f68ea7e-1520-4782-b266-e7aaac280be8","year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.495662Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:40ebbc53a27cbccdfa05f2bc2f166a3dd6d38946049be1cb66c53054c0b60813","observation_id":"63455f88-dc64-46b2-ab69-adce8736061a","resolution":{"observed_at":"2026-08-07T14:49:35.332950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:35.111695Z","title":"Experience replay for continual learning,","venue":null,"work_id":"a1e87f0a-e227-464a-a291-0d9290400bf1","year":2019},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.624338Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:48cd5de834ca61c7bf52f98c753cc2e02b93ba75f6496e103a12953a979c25b4","observation_id":"dc8e5282-bcd7-48ca-a78c-36ad036da432","resolution":{"observed_at":"2026-08-07T14:49:35.198113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:30.738275Z","title":"Lifelong learning of large language model based agents: A roadmap,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.738275Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:de82f9b3ff84865ac0bcfed1a183864a499762182b493e14088abb998cefcb20","observation_id":"e906b271-637d-4304-9b4a-dd0ad6989dd3","resolution":{"observed_at":"2026-08-07T14:49:30.738275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.961220Z","title":"Vqacl: A novel visual question answering con- tinual learning setting,","venue":null,"work_id":"b95c6b4b-2ee4-4e0d-92a4-907fe5ba332b","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:30.870400Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:0595a6d0fd3f1906ea4a606c1653a87a580d907a7ff14010facf7fcff4dc85d5","observation_id":"b11aedce-d358-4e37-9248-707740270df0","resolution":{"observed_at":"2026-08-07T14:49:35.046797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.776684Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"40f11eaf-4bb5-4732-9b33-4047584f626d","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.042508Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:793f37d9e4bb59bb5c8cd6071a446866f3c3b1c058aa20a660e6dd47d605d3c4","observation_id":"35cf9cd9-bf56-4c92-9735-e02834a7f671","resolution":{"observed_at":"2026-08-07T14:49:34.854269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.627310Z","title":"Ties-merging: Resolving interference when merging models,","venue":null,"work_id":"402c91d0-666e-4487-b828-8e547e578cb7","year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.148958Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:fe6347c230e0b9cccb9ef11ec523243f3e7500f04871832380429806c2fa7dbc","observation_id":"db61f869-be6e-4470-a759-9772d27d2f7c","resolution":{"observed_at":"2026-08-07T14:49:34.698843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.393956Z","title":"Language models are super mario: Absorbing abili- ties from homologous models as a free lunch,","venue":null,"work_id":"9d925770-458d-442b-b0f7-12970b662fd3","year":null},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.265866Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:ce5294172fc0a97eeb01bab4263c00ad2fa56917d963f30735a84967644577ff","observation_id":"fa21d37b-a771-4449-91a6-3435eabc61af","resolution":{"observed_at":"2026-08-07T14:49:34.530162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:34.117388Z","title":"Unsupervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"b1d4cb47-f284-4d11-83f3-b48c0addbbd2","year":2021},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.390073Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:78627f4e0da315dacc9749431c66a68b3bdad443e6ab731b78c636299915e2ee","observation_id":"398b79e7-8644-427f-8e5f-373c2ca90aa7","resolution":{"observed_at":"2026-08-07T14:49:34.214728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.898983Z","title":"Genetic k-means algo- rithm,","venue":null,"work_id":"120bd0e8-73fd-4593-ba0d-b3922dac38d4","year":1999},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.576695Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:4c16694c14af6303af9497f6846add3500606af1671e2f07d3efcc64f1ea29d7","observation_id":"ee97c285-be2d-4cfc-9488-fdd2a8c1f61e","resolution":{"observed_at":"2026-08-07T14:49:34.005818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.765966Z","title":"Hifi-gan: Generative adversarial networks for ef- ficient and high fidelity speech synthesis,","venue":null,"work_id":"dd40ed4b-48bb-4944-9f45-561d7ddb726f","year":2020},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.750383Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:80a2c58d0f0c7b1eeed0d9d524aedb8371b04fb49d9c57cefdf7c92b7e1b21a0","observation_id":"e8b373b7-9440-499e-9f3f-ac2a5e5cc222","resolution":{"observed_at":"2026-08-07T14:49:33.827520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.541958Z","title":"Librispeech: An asr corpus based on pub- lic domain audio books,","venue":null,"work_id":"1449b7c5-3a6d-41f2-9784-668b0916024d","year":2015},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:31.953409Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:bfd35fc255dca045329d495682b9c0c37f2ff4fcd354c299bc2c261bc6d6bb2b","observation_id":"b653935a-2441-401d-aa7f-9a6b82a1fdf8","resolution":{"observed_at":"2026-08-07T14:49:33.654700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-07T14:49:32.064798Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.064798Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:accb92a1a9d6b8b3dfcb1e21bc545ee593f23ef3ab3c67b170b271f0b62f94e6","observation_id":"6d9ed3fb-bc8b-41fc-a9b7-ad04edf37432","resolution":{"observed_at":"2026-08-07T14:49:32.064798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:49:33.360802Z","title":"SpeechT5: Unified-modal encoder- decoder pre-training for spoken language processing,","venue":null,"work_id":"0ff3d134-87cb-4b2c-8191-785420653766","year":2022},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.257260Z"},"links":{"citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:0c6b73453a88a539204ede5115d3dfc3a68490d9924509d6801dac2dcff3181a","observation_id":"85e25b7a-f8e9-46c9-94ef-00a99ae95432","resolution":{"observed_at":"2026-08-07T14:49:33.424292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T14:49:32.437237Z","title":"Spoken question answering and speech continuation using spectrogram-powered llm,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.437237Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:d89bc72165789fd6562cf003e9d9072ec4f5a878c7dea606dcce9e05f2124c2a","observation_id":"578e6321-953e-4e70-9458-bd1ed3843068","resolution":{"observed_at":"2026-08-07T14:49:32.437237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:49:32.643541Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:32.643541Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.17496"},"observation_digest":"sha256:6f7f2fcfd544064cf5a70e01c0308bb1833bdccdece04b27d9894e0a7fc0cfb8","observation_id":"3951a82a-26f5-4487-8216-8f763123e084","resolution":{"observed_at":"2026-08-07T14:49:32.643541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17496","last_updated":"2025-05-23T05:50:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:43:53.892279Z","submitted_at":"2025-05-23T05:50:14Z","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 5 inbound Pith citation observations for arXiv:2505.17496."}