{"as_of":"2026-08-05T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af9c6df8ae8b3ea7ec59a432ede08a035b6e5e603eda7e7662c0a4726c7ad967","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T13:05:29.813707Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:35:56.402445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:53:55.822643Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":"2606.01802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-07-07T14:53:55.822643Z","title":"MOSS-Audio Technical Report","venue":"cs.SD","work_id":"e194ce1a-90cb-4faf-aecf-94ab7ceec215","year":2026},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-05T14:45:39.013013Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:e1ad3f846814be9ab479be1f8cbe37d3372217d3ae9241cf5ce18bfabf2fdc7e","observation_id":"72f844c2-04dc-4cec-9949-df97b3a813a5","resolution":{"observed_at":"2026-07-01T13:05:45.831036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":"2606.01802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-07-07T14:53:55.822643Z","title":"MOSS-Audio Technical Report","venue":"cs.SD","work_id":"e194ce1a-90cb-4faf-aecf-94ab7ceec215","year":2026},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-03T03:09:40.573819Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-07T14:52:35.127533Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:7a34e2e74fd107c775e0cf2b6b322d56eae951eca6603ce223aaffc8eff7aadf","observation_id":"765abb12-078e-4eb1-b78c-613e5d6aab34","resolution":{"observed_at":"2026-07-07T14:53:55.823891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-02T08:34:07.442930Z","title":"MOSS-Audio technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-03T03:09:40.573819Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T08:34:07.442930Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:bdcfa820bde1178f50c3f2d63358d973a9268183ba0b3011284a0ec03f3e4d65","observation_id":"259ddbf8-222e-4dfc-9a60-ca007a266265","resolution":{"observed_at":"2026-08-02T08:34:07.442930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-01T19:08:12.244455Z","title":"MOSS-Audio Technical Report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17079","last_updated":"2026-07-19T05:05:49Z","snapshot_observed_at":"2026-08-03T10:23:03.109242Z","submitted_at":"2026-07-19T05:05:49Z","title":"SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:08:12.244455Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.17079"},"observation_digest":"sha256:2efc14d68a2dbc40b397e31dc924215bc283548d6b26ce432385a33caee34f22","observation_id":"1c3c4844-4d0a-458c-9cdd-2ee5f9de746b","resolution":{"observed_at":"2026-08-01T19:08:12.244455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-01T14:37:32.397890Z","title":"MOSS-Audio technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-01T17:31:58.319070Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.397890Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:8cc22840a9767a8898291121b3642dd3d305d2a2cf47b2218f77b9fddfd6dc7e","observation_id":"40ce1bda-0752-4599-90f8-53709420fa9e","resolution":{"observed_at":"2026-08-01T14:37:32.397890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-03T08:35:56.402445Z","title":"Moss-audio technical report.arXiv preprint arXiv:2606.01802, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T15:15:20.786172Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:56.402445Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:856f21f37f34671bef75c71651b7fc16c1a9ae34b7803e3d949445cfaa1cea2f","observation_id":"4ab4d448-f56a-435f-9ae3-44456c282ad9","resolution":{"observed_at":"2026-08-03T08:35:56.402445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01802/citation-record","integrity":"/paper/2606.01802/integrity","json":"/paper/2606.01802/citation-record.json","paper":"/paper/2606.01802"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:557a1db0faf11e22db83dce65518d6883354fea19fa6c439da6924ba51da602e","observation_id":"af73f21c-68b5-4ae8-9f05-e1997837d6fb","resolution":{"observed_at":"2026-07-02T00:56:25.096484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:e653bbe0ef98f7b37f82497199eb3a506d55abe0d63bca6df385e9d66893d11a","observation_id":"f448aabb-33d2-4c3d-9271-026bb43374f2","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A udio C aps: Generating captions for audios in the wild","venue":null,"work_id":"1ac1fac9-c7ba-4b7f-950f-1ad9b6bfe9e9","year":2019},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:a52ebec92080291fcfb1d77953092816adf6fd9334076f1c097fcd69e61b4b2b","observation_id":"ae8c38fa-9e02-4ccc-9d8c-db4a3f5fe9b0","resolution":{"observed_at":"2026-06-28T13:12:13.681711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/taslp","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:57:37.495900Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 29, 1161–1173 (2021).https://doi.org/10.1109/TASLP","venue":null,"work_id":"2a0294bb-fc55-4eba-a45b-81f234cda880","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:f5a3846bdf5ba69f4f855976d3f8d409f1866dd5186d72dc0f32353dd4a706e4","observation_id":"42c08a71-b4c5-4add-817f-8cc304eda715","resolution":{"observed_at":"2026-06-28T13:12:13.686139Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:12150c8927bd5cc882b7503384ad3f0bcb8e14ddedab72eb497a3745af8b9331","observation_id":"68aa2f45-0b4c-4c0e-aaa6-a43f8b2c6865","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:74fc48f23a1265055e363294d5abcd82cc065f3e1ff40610f479dfa290446286","observation_id":"f4ca3108-7a9c-4749-b2ad-8a07fd214955","resolution":{"observed_at":"2026-07-02T00:56:25.088047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"SALMONN: T owards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:536a24fb6e58882963f7b2e63dcb821d129ccfdd22536dfc19c3b8f21095baeb","observation_id":"9af80082-ed7b-4cdd-beda-7d9c93e5f27a","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:c552f6885e6a42f28e066a7502717eafa3b5d7599b4a6fe75acd47e6a66c40ed","observation_id":"ed21e055-1ae8-4962-8023-f7d1eb8b0350","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:edb759f5dfa9e9af44c5f15d816c1cfa6cd9458536751070262da6f60a250065","observation_id":"3dadd2c6-621d-4838-83a5-e8afc13519c4","resolution":{"observed_at":"2026-07-02T00:56:25.094371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:8c4524fcfd7c67d032d2e9f4db1cd5f9a6900da20a1781713c42c4fd3bcfb7fb","observation_id":"80a6f3c8-f54f-46e1-b2fc-7ba9f9949b4e","resolution":{"observed_at":"2026-07-02T00:56:25.117896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Sakshi, Oriol Nieto, Ra- mani Duraiswami, and Dinesh Manocha","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:556b6c69f4b409e08826a44da6445b2c2d30870d1d6c35c6a5b0240f4c0ce9bd","observation_id":"fa56ac27-c8be-475c-b64d-18ff7d03ab88","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10905","last_updated":"2026-04-13T02:11:56Z","snapshot_observed_at":"2026-08-02T12:37:36.973348Z","submitted_at":"2026-04-13T02:11:56Z","title":"Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music","version":1},"cited_work":{"arxiv_id":"2604.10905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10905","snapshot_observed_at":"2026-07-08T00:04:22.369734Z","title":"Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music","venue":"cs.SD","work_id":"b895d452-be18-45e2-abe2-7de7001acc66","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2604.10905","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:778b93a51efdf841291ec1a6246aaf24bd783d0ec6ef3ee23d8e2edf9c230883","observation_id":"0c0ed9ed-f01f-4924-a57e-cdbe6b4f47c5","resolution":{"observed_at":"2026-07-02T00:56:25.085342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Enhancing temporal understanding in audio question answer- ing for large audio language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:26b38b88d579375a7845be81275d9422b0945ced5b8862f9b0b9491df0235c51","observation_id":"cbf4515f-2c82-412e-82a8-fcc8532e758e","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Sakshi, Utkarsh T yagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, and Dinesh Manocha","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4d174998dca00c36c6b947217480199e165a7cd6b506b9ed5aa57fdd1d9a1e26","observation_id":"39c3e04d-08df-463a-af71-f8221bc326d2","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-04T21:45:55.994640Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":"2505.13032","doi":"10.48550/arxiv.2505.13032","metadata_source":"pith","pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix","venue":"cs.SD","work_id":"fe97a573-dedf-4e07-af07-b22508260a10","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:3a5c2c9ad6fa9677a9ca1b8bad3d5246320bc7e340d83ebeb389ca1aecb5e652","observation_id":"c1785c1d-8c56-4343-a04d-f990d3fcfe49","resolution":{"observed_at":"2026-07-02T00:56:25.042011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14405","last_updated":"2023-12-10T22:50:21Z","snapshot_observed_at":"2026-07-06T16:23:30.533693Z","submitted_at":"2023-09-25T17:59:05Z","title":"Joint Audio and Speech Understanding","version":3},"cited_work":{"arxiv_id":"2309.14405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14405","snapshot_observed_at":"2026-07-02T00:56:25.086851Z","title":"Liu, Hongyin Luo, Leonid Karlinsky , and James Glass","venue":null,"work_id":"fac93e50-ce08-4d75-b168-d16e7c7390da","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2309.14405","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:59f3248bb4d41faef118820f8e86eacc8031dd242e4a2dba8ff8797ab10fd032","observation_id":"2fa4aeee-6e4e-44ed-b021-194bd073135b","resolution":{"observed_at":"2026-07-02T00:56:25.089571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"DeepStack: Deeply stacking visual tokens is surprisingly simple and effective for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:8a1dc8e92b51b4d684b01eb37b29acfd6011f6086b201c6da6f6f9708fcc2887","observation_id":"8cf30ed0-c42a-477a-9c38-10e81a1c5d40","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13992","last_updated":"2025-08-19T16:33:49Z","snapshot_observed_at":"2026-07-06T22:15:08.135791Z","submitted_at":"2025-08-19T16:33:49Z","title":"MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence","version":1},"cited_work":{"arxiv_id":"2508.13992","doi":"10.48550/arxiv.2508.13992","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13992","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Mmau-pro: A challenging and comprehensive benchmark for holistic evaluation of audio general intelligence","venue":null,"work_id":"34fbbc93-cd79-4b11-a99d-32d597b71a37","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2508.13992","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:8fed4af0f5f74c67dc9d8afd91486bf8fb9b5ea37102adb11081317eccfc28e4","observation_id":"d7bcb2bb-69a6-48ba-85d5-6edbed107792","resolution":{"observed_at":"2026-07-02T00:56:25.050583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1503.2021","doi":"10.1109/asru51503.2021.9688007","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Transducer: A Streamable Speech Recognition Model","venue":null,"work_id":"238c59a4-538f-43ef-86fe-8dfe6651948d","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:23ffbf8b6004965250153fa0fec1163b51c664be288c1bccfda4c0aee146c7c4","observation_id":"c9a4d7d6-2427-414e-a2be-34b3cf0d5bda","resolution":{"observed_at":"2026-06-28T13:12:13.684226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:338fb0497a594996b756f77cb95ac1ac96fedd8c74373cc4da48607be41f8d2a","observation_id":"29492b91-fa32-486a-bd0b-e733ab0bd189","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:a20d45b3cc54bbfa0310c5c5560257dffc418c54b7b2692e81802e1e88be6a71","observation_id":"82c14792-db0e-40de-9be4-3c637d99cb18","resolution":{"observed_at":"2026-07-02T00:56:25.070239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:c3064ff3c38381e7efcbe6c222469a7fb6c40f32b0dde97612ed8bda622a537a","observation_id":"9155490e-5eca-45c3-b645-19c8d3a8447b","resolution":{"observed_at":"2026-07-02T00:56:25.074549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"cited_work":{"arxiv_id":"2601.01554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.01554","snapshot_observed_at":"2026-07-09T02:19:49.762568Z","title":"MOSS transcribe diarize: Accurate transcription with speaker diarization,","venue":null,"work_id":"426f7c74-e265-445b-8cf0-8327df63663f","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2601.01554","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:21a4308446578348d7a70d94b282d2784a57912e05c016abc74fae93b99264f6","observation_id":"c031f99c-4eee-4423-9a11-79cc20a86d16","resolution":{"observed_at":"2026-07-09T02:19:49.762568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:193201794494ab4d7d37621403964a208f4037c2cd59cb34c7fdbb76e7918549","observation_id":"85af66fd-6d64-46cf-82ed-a73c719d329e","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09546","last_updated":"2024-11-28T19:07:47Z","snapshot_observed_at":"2026-07-06T19:15:29.988880Z","submitted_at":"2024-09-14T22:00:47Z","title":"Effective Pre-Training of Audio Transformers for Sound Event Detection","version":2},"cited_work":{"arxiv_id":"2409.09546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09546","snapshot_observed_at":"2026-07-02T00:56:25.083164Z","title":"Effective pre-training of audio transformers for sound event detection, 2024","venue":null,"work_id":"9d525f07-e662-43bb-ae65-3f1fa0842e60","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2409.09546","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:8de4d8352718941e556bc6d88bcd03c43571d0050454764a3901c482cd695dfc","observation_id":"a674584b-8f8f-40dc-9bf0-fbe39c94a07e","resolution":{"observed_at":"2026-07-02T00:56:25.084991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:d61718fa067a6c3b1f9343ce99698900caa0ce81a4738168aecb5761cb183b64","observation_id":"991c5787-464c-4103-a247-2600900de08c","resolution":{"observed_at":"2026-07-02T00:56:25.073662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T13:21:06.298615Z","title":"Fun-ASR technical report","venue":null,"work_id":"0d0144d6-599f-4fc5-a3ac-d35c144cdd41","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:b6f368eae01b6614270a9adf35b94913a57aecdf4ae818890f78e576dd3eb1e0","observation_id":"435d8d96-5cc5-4fa0-bbd8-6286f3af106c","resolution":{"observed_at":"2026-07-02T00:56:25.020627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:6f065e20d64cf3683d999c63068c79f47fbb6012287da6cfe9d9d11ce02c3c0f","observation_id":"3540138f-e7be-41da-b26b-03a4953c4ced","resolution":{"observed_at":"2026-07-02T00:56:25.081788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Bag of tricks for efficient text classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:bc0c1d567cc327fe7354cbfba12745ce5cee0068b70e4004b20575a7ff674e7b","observation_id":"58e70b04-d5df-4ef7-be84-d9fd491a4d04","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":"1612.03651","doi":"10.48550/arxiv.1612.03651","metadata_source":"pith","pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-07-11T01:47:47.470175Z","title":"FastText.zip: Compressing text classification models","venue":"cs.CL","work_id":"cd1495d8-ba03-4095-b4d3-ea0d52c24350","year":2016},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:96f025d81ac6bd215d89d326ccd37819e24acacd6821708a130d7ac6a20f827a","observation_id":"180dc482-029c-4068-b5b0-9eb89575ada1","resolution":{"observed_at":"2026-07-02T00:56:25.024453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Scaling speech technology to 1,000+ languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4b2d46fe0276452a958499d44e3e370b9940e8605a2194a6ea48c9dfed469525","observation_id":"d5aab964-c959-454b-9230-7efd00127a8f","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Scaling speech technology to 1,000+ languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:52372878354e8e023b8ab46288f5b704648ef2c1e3ca23a3f9fc29c7bd4dd974","observation_id":"89d43869-c876-4363-b6ea-e8f5e9620074","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:dbbd50d89b27cf208a3619abcfeb5d207945fbb183e8bf8cc3bf4fc612db546b","observation_id":"a03b87e3-1d1c-434f-a5c0-672390f50972","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Leveraging self- supervised learning for speaker diarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:a44e3a77e9d9d60a504500d003cebd2522312189de152d7692142d42caf09c24","observation_id":"9cfec829-f9cd-47b5-b323-07c90c8155e2","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16343","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T00:56:25.076106Z","title":"Xiangyang Chen, Shuzhao Li, Xiuwen Zhu, Yongfan Chen, Fan Yang, Cheng Fang, Lin Qu, Xiaoxiao Xu, Hu Wei, and Minggang Wu","venue":null,"work_id":"113de848-149d-4edd-b7ea-0f1398a68b83","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:b93f3005b3100131eb671d1c5abf85eab74924304685920857a095abcc9e047b","observation_id":"9c8970c1-e9b3-4385-96df-fe2f77c33b87","resolution":{"observed_at":"2026-07-02T00:56:25.078694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.882184Z","title":"Listening be- tween the frames: Bridging temporal gaps in large audio-language models","venue":null,"work_id":"75773b5c-893c-41f1-b113-c137df6c775b","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4500ba97e76507a62696e8c4a9072389856b6ea7dcc355a1afdf3724d69e34c7","observation_id":"cabe4df8-1509-4859-98be-f8d12619485b","resolution":{"observed_at":"2026-07-02T00:56:25.106858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T00:56:25.101431Z","title":"Bryan, Zeyu Jin, and Justin Salamon","venue":null,"work_id":"0814b1f8-368b-42f3-89ea-8b0e343efce0","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4170f41dcbf7a4af9a8371fd158e14130232a903ec4124ced7da47a448734883","observation_id":"3f1b8ab3-fdad-4dd4-b7e7-880150545f25","resolution":{"observed_at":"2026-07-02T00:56:25.103097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.410532Z","title":"Music Flamingo: Scaling music understanding in audio language models","venue":null,"work_id":"686b6882-e08a-42fb-8aa1-3091508afd72","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:081941bd07a2de54bce1d9ddec2331bb14505f13e623a25e7808bd7cec45899d","observation_id":"544e3d97-bbb5-4a42-b50c-e3fec440bbf8","resolution":{"observed_at":"2026-07-02T00:56:25.014328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, and Bryan Catanzaro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:306611040c62cd07834dc4a5e1d4fb90db696f5064677832ee2e76637614ff46","observation_id":"570a94d8-0279-42fb-b1c4-ed2ab0745ded","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Approximate note transcription for the improved identification of difficult chords","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:6a9ae3ff0b14b50b75460da3d8803b86c152f57d06828f1c787a3aef172349e2","observation_id":"f0d99664-cffd-4375-9bab-48efff57341d","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Beatnet: Crnn and particle filtering for online joint beat downbeat and meter tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:7d69e1fb90e98229d722176ac1929a878c69bfa82dc8fedda0b1a9ca45a5310a","observation_id":"13dc7cf9-557f-4237-953d-65435b0cbd77","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07008","last_updated":"2016-05-23T13:29:09Z","snapshot_observed_at":"2026-08-03T12:42:11.514478Z","submitted_at":"2016-05-23T13:29:09Z","title":"madmom: a new Python Audio and Music Signal Processing Library","version":1},"cited_work":{"arxiv_id":"1605.07008","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.07008","snapshot_observed_at":"2026-07-02T00:56:24.988227Z","title":"madmom: a new Python Audio and Music Signal Processing Library","venue":"cs.SD","work_id":"c8498530-42d2-48d3-b545-ae7bfbd05104","year":2016},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/1605.07008","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:7f55c00ce7bab2601629cddb929d60e6e66ab1aff395e3f96791cc0ff5b443fb","observation_id":"46cd78cd-555b-4402-b3fe-5dfd99eb7535","resolution":{"observed_at":"2026-07-02T00:56:24.990354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Essentia: an open-source library for sound and music analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:ec36c744848fe5f1c95c0dcdb7a7e398787c4caaeb1f9aa2388acdb7149b34ff","observation_id":"c5c39b61-9ab2-42cf-bf52-15183feb8203","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2081.250222","doi":"10.1145/2502081.2502224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent developments in openSMILE, the Munich open -source multimedia feature extraction toolkit","venue":null,"work_id":"e1aaac9c-3f92-417f-ad5e-4da55b654983","year":2013},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:490b6879907e8babdd1a842163ff5a6314f6bf57ac3876d8bfbf0ab1e37a2ad7","observation_id":"62dfaf62-8a9e-4991-8e20-170792b8da2b","resolution":{"observed_at":"2026-06-28T13:12:13.688720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T11:24:50.036496+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T11:24:50.036496+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Codified audio language modeling learns useful representa- tions for music information retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:7a2efbf1328225cd33767f9eb23775bae535d609fd8d2a2190a5185768c8a7f1","observation_id":"96a6de44-74cc-458e-b677-f25f64246bed","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02797","last_updated":"2026-04-08T17:04:46Z","snapshot_observed_at":"2026-07-06T22:31:35.666707Z","submitted_at":"2025-10-03T08:10:19Z","title":"SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision","version":3},"cited_work":{"arxiv_id":"2510.02797","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02797","snapshot_observed_at":"2026-07-02T00:56:24.982810Z","title":"SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision","venue":"eess.AS","work_id":"faff9b16-0e21-43cf-af48-163193d3fb24","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2510.02797","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:87075eb5bb63e55cb51dfbd73673d4ce8b517e4f7026c6adc73381f8ac8932c4","observation_id":"892d7e75-acc7-493f-b0f1-01096d5d30e0","resolution":{"observed_at":"2026-07-02T00:56:24.984647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:92c5ff05e9c6ee37d79fe6b224c4d57d493b214c15ea660746fdcb68a6e5fa52","observation_id":"731d1eee-03d8-462a-b9b5-bc1eae320375","resolution":{"observed_at":"2026-07-02T00:56:25.110474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05409","last_updated":"2022-04-11T20:59:51Z","snapshot_observed_at":"2026-07-06T12:59:19.821349Z","submitted_at":"2022-04-11T20:59:51Z","title":"Unified Speech-Text Pre-training for Speech Translation and Recognition","version":1},"cited_work":{"arxiv_id":"2204.05409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05409","snapshot_observed_at":"2026-07-02T00:56:25.008128Z","title":"Unified speech-text pre-training for speech translation and recognition","venue":null,"work_id":"b5949b4e-e445-4fc1-8a5a-bffe322bb463","year":2022},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2204.05409","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:9426f92c856a3cfe81928c54fe10f1c78be30c31cfba306f37802d3c61c73919","observation_id":"a3a7cb2a-6403-4ac3-afa6-4eb6e0ac3465","resolution":{"observed_at":"2026-07-02T00:56:25.010703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":"arXiv (Cornell University)","work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:f97a6dc265d1553918f3fbc1605cdd784bdb10ff8a425615b8424dc948de92a2","observation_id":"3cc14cf4-5788-4e9a-b665-2d17d061b13e","resolution":{"observed_at":"2026-07-02T00:56:25.093347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Spirit-lm: Interleaved spoken and written language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:453aadd82368f013d8bf24d3654e1de3e562a0beb9bd08b6de9d0c659fba742a","observation_id":"30a14c5d-4d17-4ed7-8736-72fb790a3865","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:e3fc690de7dcffe0416d3f2eeb0bd5bb8f61a0ebd15244dddd25a1477c747d31","observation_id":"96592c46-965e-4138-bf16-40c353f910c1","resolution":{"observed_at":"2026-07-02T00:56:24.997694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:42b768af27451572364c6a58a5fdc939febdd6e8cd04b62580b6ee33124b0289","observation_id":"314060b0-211a-4bc5-82a2-6dc28975b8ea","resolution":{"observed_at":"2026-07-02T00:56:24.982340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:e48273e3b96fa80cf276c3022d667a9f6265c037179f71c2df33bc16786fadf7","observation_id":"363b0d7f-2e34-4f19-b7e8-1c3d336660ec","resolution":{"observed_at":"2026-07-02T00:56:24.986552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-07-06T20:41:42.199592Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":"ArXiv.org","work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:eda85aeba2ad68dc94c984a083541692ef1c1574353e74d5b1c398072d5de721","observation_id":"181163d2-d0d8-453f-8e9a-015a68694417","resolution":{"observed_at":"2026-07-02T00:56:25.114734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4952cce63c21ff22cd33478d35d690bc617bcde2171f89186b414ea8cddab8df","observation_id":"d4b3731c-80aa-49c6-84d1-d6fe04227c59","resolution":{"observed_at":"2026-07-02T00:56:24.977576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:c7b340c9b52255eaf1a00eddab2f86b0d731e9a9294a2f07fcad65afd5035269","observation_id":"971d39a6-a5f5-47b7-909f-c7eb6657c1bf","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"CLAP: Learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:fb811304b76485e4378f3ab989c4eb86a87433a310d531365c247b4f76c74782","observation_id":"3992ce51-9e1f-41ea-9f6e-6ae2ebcbacb9","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:b32110f664a3ca3e8f7d98e6e10cce8a0ada23059c25254d5b8080feae8877b7","observation_id":"9cddd868-3b8f-4fc0-b0e5-10c8b458dd5a","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:538beb18fefa6606fb61d23ff143d907168571e4e5626f4bd7fa2d95f13f9ce4","observation_id":"7fb0502f-60fc-4dec-b079-65cbe03b1652","resolution":{"observed_at":"2026-07-02T00:56:25.028612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:b3785d625aac23fcbf24cc28b91125ace6754752414180095e819daf9d3ad955","observation_id":"9483aace-6f76-4ce4-8758-b80fa5199566","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-04T07:40:37.826866Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:ce6417efb9afce7a40d824e9929b31c89d17d373d42d332ab097a7899cdb4888","observation_id":"c02b7ec1-3b85-4b62-a36a-ec76c0345d7d","resolution":{"observed_at":"2026-07-02T00:56:25.032216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T13:05:29.813707Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:5cb450ad5a2ccf4b804ce8e141678ddb06e23c7847f3a93fc6f42f25f13f7e39","observation_id":"1065d7de-b651-49af-9d75-51695c2fc376","resolution":{"observed_at":"2026-06-28T13:05:29.813707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13023","last_updated":"2026-04-14T17:57:01Z","snapshot_observed_at":"2026-08-03T18:18:13.717802Z","submitted_at":"2026-04-14T17:57:01Z","title":"SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding","version":1},"cited_work":{"arxiv_id":"2604.13023","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13023","snapshot_observed_at":"2026-07-07T14:53:55.890666Z","title":"SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding","venue":"cs.SD","work_id":"391b8c39-00e7-476e-8ee1-5233a3dbc517","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2604.13023","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:4d8fc281cf11109669b478ae03ddeda0307d73b545be79379f81b4da3ec6073b","observation_id":"91131f25-74cd-4d44-9320-fcf040698176","resolution":{"observed_at":"2026-07-02T00:56:25.001719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":"2411.18211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-07-03T10:27:56.044849Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability","venue":null,"work_id":"096f37ba-17eb-4a5f-8559-3ab32ce1a3ed","year":2024},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:32fe1a9e105a94fd9a94ed9ddf237228704061e94cd94f48d011c9f651c7ce9c","observation_id":"bec92328-9791-408e-9a7c-b75b49aadede","resolution":{"observed_at":"2026-07-02T00:56:24.957516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22728","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T00:56:25.098159Z","title":"The interspeech 2026 audio encoder capability challenge for large audio lan- guage models, 2026","venue":null,"work_id":"745dfdee-06fd-459b-916d-efae8d6ecc03","year":2026},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:b24a9e400890be4fd3b7fa6d47dab8a87694911ecc66aafa15b9dfd1eba016e2","observation_id":"0e53b4a1-9a58-4b03-aca8-204bec188cd6","resolution":{"observed_at":"2026-07-02T00:56:25.099974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"cited_work":{"arxiv_id":"2507.23511","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23511","snapshot_observed_at":"2026-07-05T12:30:59.899367Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","venue":"eess.AS","work_id":"a6502958-79ac-4cd6-ba6e-93629638a2f2","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2507.23511","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:3904a5158291b361b2156169b78d4adcb18756f6bdfbf8b5702eebb795470be6","observation_id":"85c0811a-7d11-4253-898c-821335d34d10","resolution":{"observed_at":"2026-07-02T00:56:24.960610Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":26,"verified_exact":33,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 6 inbound Pith citation observations for arXiv:2606.01802."}