{"as_of":"2026-08-19T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:191020f9752dc3e9accd17514779e3c2115cee0d1f90fc412778c4e325c651c4","coverage":[{"denominator":233,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:12:17.572218Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21550/citation-record","integrity":"/paper/2607.21550/integrity","json":"/paper/2607.21550/citation-record.json","paper":"/paper/2607.21550"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:06.756641Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:06.756641Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:27e94b3c340d22197e45cdc540e7028ed0122a2b77f4e06a369ffe060a0de8c3","observation_id":"e5715848-40de-4ea2-9290-1d6634e81f78","resolution":{"observed_at":"2026-08-01T07:12:06.756641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:06.834197Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:06.834197Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:88a2f12b0768e1f4e57151cdf75c0b8aec00e6badc714f27131fd4613f070926","observation_id":"f327697c-0e8f-45b2-a46d-03dadc3ddf77","resolution":{"observed_at":"2026-08-01T07:12:06.834197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:06.938263Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:06.938263Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:58845606ba78b6e4c817bd931314abd5fcaf337de2c17b49dfc7b0578809c91b","observation_id":"4cc9e917-5c4a-4b69-9c69-98fd68785d60","resolution":{"observed_at":"2026-08-01T07:12:06.938263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.093622Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.093622Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d7d1435c2a5cafed93ce59d43b11ab39cc9e555cc413ec0b577e026ec7165354","observation_id":"088b67c6-abff-41f9-a533-6c3f636bb6e1","resolution":{"observed_at":"2026-08-01T07:12:07.093622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.260687Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.260687Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:941fe621b20810a02f050b7dcae0f7f27b93e8c95c0878d2377b4271f8b33984","observation_id":"0917e93f-2422-4f06-a968-480cd27278d7","resolution":{"observed_at":"2026-08-01T07:12:07.260687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.416008Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.416008Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8e481158cad750083786bf2d157a23734ac92a140f8aa2f990634f6b1690d21e","observation_id":"d7bd3ee8-a727-4a3e-b53e-803113813988","resolution":{"observed_at":"2026-08-01T07:12:07.416008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.593193Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.593193Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d2f3ceb8a63edd9de62c7e3f515e5dea56eb23740667e11a5e8174748c78bced","observation_id":"6aea00fd-e092-4ee4-8bcb-6a038f717ab9","resolution":{"observed_at":"2026-08-01T07:12:07.593193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.727557Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.727557Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:850c26cc44e8d0c94fdb7d509d403435a03fffe83f34e3778d53d8453ab7f82a","observation_id":"b8185f40-55c2-416a-9de7-913595996a98","resolution":{"observed_at":"2026-08-01T07:12:07.727557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:07.854999Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.854999Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:352ef3cb20925300d2e85507c2ea54da6fb4622616868a599424d33e81ab12bf","observation_id":"e25d93eb-e36e-4909-9e71-0980a8d6e671","resolution":{"observed_at":"2026-08-01T07:12:07.854999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-01T07:12:07.986457Z","title":"arXiv preprint arXiv:2507.16632 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:07.986457Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8d224f1e67273de0afd7043b71f16ec8879fcbb465f919648a75cdbf729818f2","observation_id":"83cc3342-d0dd-4fe6-949c-13595d840cd0","resolution":{"observed_at":"2026-08-01T07:12:07.986457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15649","snapshot_observed_at":"2026-08-01T07:12:08.148931Z","title":"arXiv preprint arXiv:2412.15649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:08.148931Z"},"links":{"cited_paper":"/paper/2412.15649","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1f57472fb5cbfc3cf998a66175aa16af572cfb107b336cdbd63f535e95bfeeee","observation_id":"46fb2046-e84d-4c07-840c-83b750e7cd33","resolution":{"observed_at":"2026-08-01T07:12:08.148931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-08-17T22:20:20.496099Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-01T07:12:08.294139Z","title":"arXiv preprint arXiv:2507.08128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:08.294139Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3a3979dd9b447ddc39dca0a35ad740934136f0a9899fdb46b5e59db26af602ca","observation_id":"72a440c8-4c3a-4ec3-aedd-53308aac27f0","resolution":{"observed_at":"2026-08-01T07:12:08.294139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:08.454212Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:08.454212Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:865de6dfc86973527a9f51e764f10c53c5d9ac239fe4ebd90d15961cff8cad8c","observation_id":"101d21f0-8e8a-42fe-a32c-51224e641643","resolution":{"observed_at":"2026-08-01T07:12:08.454212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:08.633748Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:08.633748Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8e4cad4289ec3e302a1e9e01fe9068d952d78c2a5da69c1447b821aa0987759d","observation_id":"bee5254f-8fec-4d1d-9913-05f4bb2b7f41","resolution":{"observed_at":"2026-08-01T07:12:08.633748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:08.772091Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:08.772091Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:471b198c0d96bf2e0ea0e4933db852fa8ceb562ad4b7a911747db6a57c5cbed6","observation_id":"ee2d21fb-74c6-4651-8323-41a72afe571f","resolution":{"observed_at":"2026-08-01T07:12:08.772091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.055716Z","title":"https://cdn.openai.com/gpt-4o-system-card.pdf , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.055716Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:04082fe3d4bd21806c41479fe931ca21f42181e62f0c33ba58f4546b87ea7250","observation_id":"485d7e01-2773-4c0f-8bfa-e4f75d2375fc","resolution":{"observed_at":"2026-08-01T07:12:09.055716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.199962Z","title":"https://openai.com/index/chatgpt-can-now-see-hear-and-speak/ , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.199962Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:449de74d5647513b7c66a70661a98cfe20614851f622dad52b87b6a5f46ef086","observation_id":"78a30ecc-3368-46ef-89e9-581d48552d13","resolution":{"observed_at":"2026-08-01T07:12:09.199962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.320404Z","title":"2009 , publisher=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.320404Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:019f87dd61f383db3de94be1c918c46620267fcca5a01e5c709c09d8875b721e","observation_id":"a9f3aa32-2b0a-4df9-8681-485e09de9725","resolution":{"observed_at":"2026-08-01T07:12:09.320404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.455539Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.455539Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2d3b7b2a81d8fa2c4ff6c48ed128affdb03c0c6e31b7cca6666d8d421628e522","observation_id":"5eea0196-5cd2-429f-bdc8-c28a9be84a81","resolution":{"observed_at":"2026-08-01T07:12:09.455539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.517358Z","title":"International Journal of Speech Technology , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.517358Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:947c22b476d1e2e7fa7bf77561fd8f71e308f78ea3074a9caa948deaeda72ad5","observation_id":"ee87b208-b527-4a46-ab69-651fec2e2632","resolution":{"observed_at":"2026-08-01T07:12:09.517358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.599563Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.599563Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:6d6edd4f64b8bd5385ed351ea5109f13395a2a2d584cda17d50b06f932bbb2db","observation_id":"a6a840f9-ef49-49e9-b96b-65268a27ee67","resolution":{"observed_at":"2026-08-01T07:12:09.599563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-01T07:12:09.684733Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.684733Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:74b52ef94da0df3079a27558f40ac6f9f792b0a2c9b86751b9195f191a803543","observation_id":"4d49bade-5a8e-4f9a-8d24-84856afda852","resolution":{"observed_at":"2026-08-01T07:12:09.684733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.767021Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.767021Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4c86a21e06a10c3067f0b26df30366adb3b8374efeeecc1f268a378960406b08","observation_id":"6722b941-deab-4175-8dfe-6088a097031f","resolution":{"observed_at":"2026-08-01T07:12:09.767021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.847222Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.847222Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:6e6c351c1cee1ac2acd69e6c52b1ac9328db16ec0ec40c8f00a007ee646055df","observation_id":"ab6ad535-b454-4a7a-b44e-43a4407ff4bc","resolution":{"observed_at":"2026-08-01T07:12:09.847222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:09.927490Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.927490Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:26b4d1ed30dc3c64c10978ebe75e1ac052e2fd507d75f20dceca304b9d76107b","observation_id":"20155239-a0ad-491b-a478-9f6901150394","resolution":{"observed_at":"2026-08-01T07:12:09.927490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-16T14:22:01.900523Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-01T07:12:09.988524Z","title":"arXiv preprint arXiv:2402.01831 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:09.988524Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d56af864da305e8639038de440bd4c0a6427e9d2db6550154a9e1a779b9ff50a","observation_id":"f64c19ce-d65f-420d-8d49-364838d3480b","resolution":{"observed_at":"2026-08-01T07:12:09.988524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-19T05:23:55.031463Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-01T07:12:10.070955Z","title":"arXiv preprint arXiv:2305.11000 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.070955Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:a3a8116564e7c36f0ba9370bc76229088c30303bd686ac1128f81eed966e33c7","observation_id":"4d351f54-86e3-4725-925c-88f850bc0b3b","resolution":{"observed_at":"2026-08-01T07:12:10.070955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.153355Z","title":"Acoustics, speech, and signal processing, ieee international conference on , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.153355Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:59ba1ec6112a7e11739bc26b13fe5628c371422f93c444e62901b84a13d9cc09","observation_id":"4977d279-9efb-4c3e-85ac-e0f92bdb0309","resolution":{"observed_at":"2026-08-01T07:12:10.153355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-18T11:18:27.643786Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-01T07:12:10.212235Z","title":"arXiv preprint arXiv:1810.02508 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.212235Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:9fbc16f1ddb16603fd0677091b66b1af7e47219dea60a0741d8bd097564b9870","observation_id":"246322d0-02e8-47f8-a425-78bdd04036be","resolution":{"observed_at":"2026-08-01T07:12:10.212235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.290516Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.290516Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:9328d646f0a067c569d80876a19233d202f94010ea375941a2f5a7ac39417282","observation_id":"52efee45-f724-4463-8a43-d4f929878baf","resolution":{"observed_at":"2026-08-01T07:12:10.290516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.349619Z","title":"Language resources and evaluation , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.349619Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:44c96528888c982b67dd1d53d99fedbc51bbb824bae9eacf74a5ae969cbfd796","observation_id":"f0fefe6b-67f9-407f-8c10-6c53607a2e75","resolution":{"observed_at":"2026-08-01T07:12:10.349619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.413911Z","title":"Proceedings of the 15th annual meeting of the special interest group on discourse and dialogue (SIGDIAL) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.413911Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:167b3f23360d81188b54a81672e1b0e38a289e18fa59b4181a10f718da3295fd","observation_id":"acaaa15d-3a5b-44be-9078-d94072db7188","resolution":{"observed_at":"2026-08-01T07:12:10.413911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-16T15:09:17.839357Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-01T07:12:10.474782Z","title":"arXiv preprint arXiv:2308.05725 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.474782Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4ca749c433ebfd81227c8a32d32df01b01aa3d11e286065ba1de0a542464ca4f","observation_id":"256e3517-1a63-4ca0-b573-407c72110a94","resolution":{"observed_at":"2026-08-01T07:12:10.474782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.532059Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.532059Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:226b8cb5b0f4a8e8a4b9ae5f0f578daa7b625f1ed122d842846d7bc30f2d64c1","observation_id":"0a077164-05fb-4d99-bc22-0a90c183f1c2","resolution":{"observed_at":"2026-08-01T07:12:10.532059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12786","last_updated":"2024-05-30T09:06:34Z","snapshot_observed_at":"2026-08-16T14:17:03.093515Z","submitted_at":"2024-02-20T07:51:43Z","title":"Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12786","snapshot_observed_at":"2026-08-01T07:12:10.622660Z","title":"arXiv preprint arXiv:2402.12786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.622660Z"},"links":{"cited_paper":"/paper/2402.12786","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4c32dc60e2da174c1b4eaf1d2baaf95eb7a5be194355d5dca35600a4b6a5ea91","observation_id":"8cac6bd0-c1bc-4bf6-8b32-02864f55f387","resolution":{"observed_at":"2026-08-01T07:12:10.622660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:10.726722Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.726722Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:f7b9bfed4b02825d6b63b3b48c2f61389c111f9c27de8c8a2e32cb95d025df78","observation_id":"8851f57e-099b-40a7-a95a-cc9680a588c1","resolution":{"observed_at":"2026-08-01T07:12:10.726722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00475","last_updated":"2024-07-27T07:45:43Z","snapshot_observed_at":"2026-08-16T14:30:38.416427Z","submitted_at":"2023-12-31T12:29:12Z","title":"E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00475","snapshot_observed_at":"2026-08-01T07:12:10.901933Z","title":"arXiv preprint arXiv:2401.00475 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:10.901933Z"},"links":{"cited_paper":"/paper/2401.00475","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4a319ff9d5cdd215219f92c82a58681f327efc949840da6928bc06b9b85928dc","observation_id":"2b21b3ca-b6b4-40c7-8dc5-4c487328d496","resolution":{"observed_at":"2026-08-01T07:12:10.901933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.069973Z","title":"PCWorld Retrieved October , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.069973Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:fb749e1fa198dc7ce9647ab32655f2f4d987628e27782e2e46597c3f359c8e97","observation_id":"64971b66-3ff6-48c4-847d-96dcacdeb01c","resolution":{"observed_at":"2026-08-01T07:12:11.069973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-16T12:55:42.223198Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-01T07:12:11.242181Z","title":"arXiv preprint arXiv:2502.17239 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.242181Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:125b137025de377f236ddd2f2e2a6a53652956aa244cf6fcab5e3100309314d2","observation_id":"5e51c39d-defd-4a26-86bf-4cf89f94e98d","resolution":{"observed_at":"2026-08-01T07:12:11.242181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.398365Z","title":"Medical reference services quarterly , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.398365Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:aca97d7b5abaec8853492ea0559bed50b1f41610dc1ba7c345683e8b27dcecd3","observation_id":"57453f28-eb6e-402b-a255-ad737c671313","resolution":{"observed_at":"2026-08-01T07:12:11.398365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-18T15:57:37.984685Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-01T07:12:11.459753Z","title":"arXiv preprint arXiv:2312.15185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.459753Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:7201ce1f59175d3eed077b3e38ae2965fd160b3a2e1a118aee1baea28a79279f","observation_id":"e98932ef-6fc6-4774-b43e-c1653e5faa6c","resolution":{"observed_at":"2026-08-01T07:12:11.459753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.546538Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.546538Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1d17fcddaa79ec542da980cd08308b97ee14a65fe50380c943a59eab435c0860","observation_id":"5d988626-77ea-4a0a-a71e-28ddacfb1f1b","resolution":{"observed_at":"2026-08-01T07:12:11.546538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.628642Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.628642Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:186a15031b57411dd5f87cb0678946e1ca800256e1e12e8821f2a23cc58e122f","observation_id":"a74e8fc7-d053-4e79-b5e4-9a50930558b1","resolution":{"observed_at":"2026-08-01T07:12:11.628642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.732058Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.732058Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3d5b8c8b212dc67f2388f0c2891db22cde0aa28bedabdd52ef8bf3fc0cce7196","observation_id":"3474efc5-4f5c-4a75-8ad1-1ee3d4184eae","resolution":{"observed_at":"2026-08-01T07:12:11.732058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.930013Z","title":"Proceedings of the 40th annual meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.930013Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8c682f11a29409a9ce70a3d82e9a02057376b1e0ae57ce6956e9a03a2e027f32","observation_id":"b0730a86-9db4-4bf7-982e-c9ac644c3e76","resolution":{"observed_at":"2026-08-01T07:12:11.930013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:11.971081Z","title":"Text summarization branches out , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.971081Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8a79f3b7c3ced39d46baaef4e8d3522a6ae160b6aa2271542be04c4cdf6d9bc9","observation_id":"e9bae5a8-7636-41fd-a00f-b72ba6ed2f8b","resolution":{"observed_at":"2026-08-01T07:12:11.971081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.092018Z","title":"Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.092018Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1a35d5d8e6d0f737fe75771321b9220baf8c7ee11df6d30596c623d982a51710","observation_id":"c7d358ef-e263-4686-bcde-1e1eaf98190c","resolution":{"observed_at":"2026-08-01T07:12:12.092018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-01T07:12:12.186994Z","title":"arXiv preprint arXiv:1904.09675 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.186994Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:9c202b0061d3bab9a90373089d7038e817e64d0ebd1a89c4ed3b6c8c1377fa2f","observation_id":"94c15fc3-4315-405e-9ecd-a143f547e081","resolution":{"observed_at":"2026-08-01T07:12:12.186994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.289894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.289894Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:b71a74ce64039afd9ee64bddddd52c2c29ae57d0d5395301962bdd3d3db8a95d","observation_id":"47553334-8e5f-485f-9fc3-c4c39eb394af","resolution":{"observed_at":"2026-08-01T07:12:12.289894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.382374Z","title":"Proceedings of the 2015 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.382374Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:cc17a3e4230f666d54fd57d5f36bb3430e0ef764cfada04b74616abcafe9777d","observation_id":"0a05c3c2-ccb1-40ed-bff3-ee5e2d174595","resolution":{"observed_at":"2026-08-01T07:12:12.382374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.481058Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.481058Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:63ee332e4ae714c518c29eebfe42cfcacdbc53212e9681135f4176aefd9632e4","observation_id":"bf01ea21-adfc-4f0d-ac04-56124e9a977b","resolution":{"observed_at":"2026-08-01T07:12:12.481058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.556830Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.556830Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:42595da3e062cc357e8be0d65b4c9a40e248bf6a24b22ab7c13bfc6433fe28e5","observation_id":"88afe302-0d6e-4d8a-81c7-d889ef53df20","resolution":{"observed_at":"2026-08-01T07:12:12.556830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T07:12:12.619135Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.619135Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4123636144e75ba8a5ad1056e645106bb784fc73b080db4bdb0481d70d5cad75","observation_id":"c737f141-3e85-4f47-8da6-15215ba5abff","resolution":{"observed_at":"2026-08-01T07:12:12.619135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.722309Z","title":"AIR -Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.722309Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d7cc7b876e0df283d318826f81f477cbdd9ae8527ba68ee967bb0efa79cce0c0","observation_id":"ac4750f5-df8d-4cf0-b632-758959a915dc","resolution":{"observed_at":"2026-08-01T07:12:12.722309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.789704Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.789704Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1cd5cd2c06d42fca5b1ce6cf32bce9196b433abab2fcd98c82c5bb74a071f587","observation_id":"34e00dab-3979-45ff-a610-3e9cc738bbae","resolution":{"observed_at":"2026-08-01T07:12:12.789704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:12.851050Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.851050Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2c0bda9e82d8c0b594d053b16936e225ce11273e1b388905b21e5ba1c89a70ed","observation_id":"8c4c97bd-8c9e-4f18-9c4c-a053c5fea72c","resolution":{"observed_at":"2026-08-01T07:12:12.851050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13340","last_updated":"2025-01-16T08:34:36Z","snapshot_observed_at":"2026-08-16T13:41:32.795501Z","submitted_at":"2024-06-19T08:46:29Z","title":"SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13340","snapshot_observed_at":"2026-08-01T07:12:12.911134Z","title":"arXiv preprint arXiv:2406.13340 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.911134Z"},"links":{"cited_paper":"/paper/2406.13340","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:ed09c2ec590700d4393cf368ab3fd567a72c91d0a706ef30a678e10ade7e7218","observation_id":"eeac6aa0-6d14-4af2-a656-689ff120777a","resolution":{"observed_at":"2026-08-01T07:12:12.911134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-16T13:15:03.146180Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-01T07:12:12.988342Z","title":"arXiv preprint arXiv:2409.18042 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:12.988342Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:bc6385808a0602e41fd307fe286e7530b283f292ba1d5bafcf4a219dda486e64","observation_id":"d65ae3e8-d898-4b20-bd84-c976d9391b04","resolution":{"observed_at":"2026-08-01T07:12:12.988342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.058354Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.058354Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:5c38dfccc46006dbc6020064e5386b76eb96ec048b51f36f7c3366985bcfcf2a","observation_id":"537b5764-7b62-40b8-b487-ac214c907a15","resolution":{"observed_at":"2026-08-01T07:12:13.058354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T07:12:13.127289Z","title":"arXiv preprint arXiv:2409.06666 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.127289Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:c3542ba92c31b09ae083fe86b0a50bf2856ccd1925aece65d0abe7e6b88a4a56","observation_id":"788183f2-e31e-4971-a137-16cb22e0c543","resolution":{"observed_at":"2026-08-01T07:12:13.127289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.218676Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.218676Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d2023194151f7ec06ba6f523cf18c19e455842c0cbef9eec00177c209b57ba43","observation_id":"85185671-4be5-4501-b00f-36aa0bf3d94e","resolution":{"observed_at":"2026-08-01T07:12:13.218676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.300557Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.300557Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d52987c7b577b58e564c89396ae8882becf0eed024304e224515fc66c65df2f7","observation_id":"da57ffd8-7705-4d92-8a51-a7d843c25581","resolution":{"observed_at":"2026-08-01T07:12:13.300557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-18T04:58:50.674492Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-01T07:12:13.375070Z","title":"arXiv preprint arXiv:2401.09774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.375070Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:f25107bd5c46c333aefbe2938c0b6bd2567333a9613faa21bfbd5235cfe782bc","observation_id":"3ade6424-1a5d-4c06-a5bf-5b2ab43eb11f","resolution":{"observed_at":"2026-08-01T07:12:13.375070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.484221Z","title":"arXiv preprint arXiv:2503.02318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.484221Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3168304c5b14e63324091eac1d9a467458ad6f727923b43aa08454c7e93f7e28","observation_id":"91e29d06-1446-4d36-972a-27d491729775","resolution":{"observed_at":"2026-08-01T07:12:13.484221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.561062Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.561062Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1903fd2bc74f6670896dfbf33ea7aecf119b4aa1c24de4e69ddaf31173f704a8","observation_id":"5ad67401-fa29-4e19-ae9d-06f0da398954","resolution":{"observed_at":"2026-08-01T07:12:13.561062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.1251982","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.5281/zenodo.1251982 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"bd37d37b-73bf-42ec-806f-db096ab5dba5","year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.767987Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d72e3796afc7f23670683daf4da2b5676f506022e68d410c00bae52ac59e876b","observation_id":"847507f7-43bc-4b2e-9f8a-cc64315c3893","resolution":{"observed_at":"2026-08-01T07:14:10.687930Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:13.978068Z","title":"Proceedings of the 33rd Annual ACM Conference on Human Factors in Computing Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.978068Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:9ad4a52a22284b9548332b47680eba47615ed715a3929b5642fbc5028be3b6aa","observation_id":"54777cc6-4c33-474c-ad29-200716bdb6b1","resolution":{"observed_at":"2026-08-01T07:12:13.978068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-01T07:12:14.152450Z","title":"arXiv preprint arXiv:2305.10355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:14.152450Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:b9cc9f0e5356b86654ea8e923347b3b5ccab8bf5a4c98433fdec4622045286a9","observation_id":"3de9232a-1ecc-4aae-bd1c-cf3263bb4b4c","resolution":{"observed_at":"2026-08-01T07:12:14.152450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:14.375866Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:14.375866Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:0d608f5fa894ce51a451f76f24d78a2b0c0a5267e796f57874db3a5b60524f2c","observation_id":"4225fb6d-d4d5-47c5-b176-a716dd65f93b","resolution":{"observed_at":"2026-08-01T07:12:14.375866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-01T07:12:14.607895Z","title":"arXiv preprint arXiv:2302.04023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:14.607895Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3da0f3d8c2296ac4767bf656dfd2b5da3f3481be5e5ce304ac57c20f8718f23a","observation_id":"6d6df894-ae6d-4756-b326-2297a6a1578d","resolution":{"observed_at":"2026-08-01T07:12:14.607895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:14.822627Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:14.822627Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2be2775fd245ff91cadb7b232b1986d361208a4b0b6aa6f2d9c16ac8785ff5fc","observation_id":"9c5e98ce-e9c2-481b-9d03-7c4b010f9b61","resolution":{"observed_at":"2026-08-01T07:12:14.822627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-18T17:08:32.043666Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-01T07:12:14.955221Z","title":"arXiv preprint arXiv:2310.08753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:14.955221Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:222fc3d6c0557dd44609bfdfd317b3d79ba7ecd5024b5a1b130ee60547f64b2a","observation_id":"15e0ed74-aff8-4d29-ba38-0b9a098f85cb","resolution":{"observed_at":"2026-08-01T07:12:14.955221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:15.101215Z","title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.101215Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:bb6ebf1c228b2650ae3b8e83164e4b08463bf6a8823661343c2f4806e98ff410","observation_id":"2266438c-c857-43bc-9626-7a2a9a070e10","resolution":{"observed_at":"2026-08-01T07:12:15.101215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:15.271713Z","title":"2024 Conference of the International Speech Communication Association (INTERSPEECH) , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.271713Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:0e2ce6d4883e341f1e673164277f63a20f0300fb9f346996498128f6bb23dea6","observation_id":"27fa3c65-bbcb-4518-8b61-c2db9a331c32","resolution":{"observed_at":"2026-08-01T07:12:15.271713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-01T07:12:15.461952Z","title":"arXiv preprint arXiv:2412.02612 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.461952Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:884874046df85c95a37d8b4f20f1d6b3ea1c68577583ccb2a546439f9c4b807a","observation_id":"798d44f9-d625-476e-b436-eb0ef3435f70","resolution":{"observed_at":"2026-08-01T07:12:15.461952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-01T07:12:15.632025Z","title":"arXiv preprint arXiv:2310.13289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.632025Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2ea94a5b473087a627a6a0d3a7a9ed37c946b22739c30da3a9274cdbb8367928","observation_id":"424ba466-d2a2-41b6-846d-a9a8d457e801","resolution":{"observed_at":"2026-08-01T07:12:15.632025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-01T07:12:15.816142Z","title":"arXiv preprint arXiv:2406.16020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.816142Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:6bfe5c9ed9be38a5607d45bb592ce47374eed83ea4fa21cdfb362b1d759823a0","observation_id":"e5c0c47f-6b82-4139-b0e8-2c95d94bf9d0","resolution":{"observed_at":"2026-08-01T07:12:15.816142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-08-12T16:45:40.094278Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01990","snapshot_observed_at":"2026-08-01T07:12:15.903633Z","title":"arXiv preprint arXiv:2504.01990 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.903633Z"},"links":{"cited_paper":"/paper/2504.01990","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:920694399708e6572e3a7fb09c27739dbe6ec877b7285769d746464a6fcd2cae","observation_id":"aa1a1529-2aa6-46ad-8c87-452f3da9e328","resolution":{"observed_at":"2026-08-01T07:12:15.903633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-01T07:12:16.034175Z","title":"arXiv preprint arXiv:2502.11946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.034175Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:f7c843b4d7c41e605bcd3650e3bc0439e00de57441256d0903c7ccaca22cfa86","observation_id":"b1511d11-6966-4856-8b76-de8a36588d31","resolution":{"observed_at":"2026-08-01T07:12:16.034175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-18T17:08:31.241240Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-08-01T07:12:16.095101Z","title":"arXiv preprint arXiv:2410.18325 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.095101Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:19f2b413a4b6275d2bd29cca88d9aa036d61a05f9ca3e2d77ed4a3d57ad2e5ba","observation_id":"4125ddc8-3dcc-4bea-9ca8-136e363c02fe","resolution":{"observed_at":"2026-08-01T07:12:16.095101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-01T07:12:16.146281Z","title":"arXiv preprint arXiv:2306.14565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.146281Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:18024324f4e811b9598cda9c0656e4c0108cae3e41bdce2058d9fa783e65af45","observation_id":"4375b592-f9ba-4093-8b3d-6fcc451728dc","resolution":{"observed_at":"2026-08-01T07:12:16.146281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-18T12:52:38.378038Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-01T07:12:16.200386Z","title":"arXiv preprint arXiv:2311.03287 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.200386Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:79a60dcf19de72dab6e847f9e1dea557f26ef79dc17e357cee72fea35b7ba9f1","observation_id":"ae8db77a-1ced-4a00-901d-ca31dd04de34","resolution":{"observed_at":"2026-08-01T07:12:16.200386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:16.341950Z","title":"International Journal of Computer Applications , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.341950Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:88b6df924799513deb5e1aa655993a605a2740ad0ed5a1317db6c00d43b8d08e","observation_id":"53654071-4067-4275-b19c-607b39c4e9d1","resolution":{"observed_at":"2026-08-01T07:12:16.341950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-01T07:12:16.390007Z","title":"arXiv preprint arXiv:2410.19168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.390007Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:dd0971d89745932f09b76009e79a194025b77c576e1a3b805db9899c51253dd0","observation_id":"3720dd43-b85a-41ec-b2c4-d263f33ec55a","resolution":{"observed_at":"2026-08-01T07:12:16.390007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:16.437302Z","title":"2017 IEEE international conference on acoustics, speech and signal processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.437302Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:0e37a1f58e0f23a7da5aa0ad1ad4db737bf17640a765f4cd75f87f236638501b","observation_id":"b380fad3-7681-4a7d-9d9f-5faba4309e90","resolution":{"observed_at":"2026-08-01T07:12:16.437302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:16.510602Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.510602Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:09e57cea1a683235c1d56209ffb0205d1a3d020931c56c3b73e4cbb8f861c11c","observation_id":"599b2daa-9040-461b-83ca-e872bee9b881","resolution":{"observed_at":"2026-08-01T07:12:16.510602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-16T12:50:05.916488Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-01T07:12:16.661745Z","title":"arXiv preprint arXiv:2503.11197 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.661745Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:d8995f030d83fde216652faab4710242903d38278ddaf1947b4c46f45135c9ce","observation_id":"18352f4d-a462-4945-a5a9-133ff75fc6eb","resolution":{"observed_at":"2026-08-01T07:12:16.661745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-17T07:59:38.221655Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-01T07:12:16.774057Z","title":"arXiv preprint arXiv:1606.06031 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.774057Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:8adb12c435b7018122f67d4a12ba44de3c1fe68eb2830e70f5ae2a110d381329","observation_id":"a7b89f91-fc62-4b2f-a55c-280fec50ed11","resolution":{"observed_at":"2026-08-01T07:12:16.774057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-08-16T15:14:33.678225Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-01T07:12:16.866244Z","title":"arXiv preprint arXiv:2307.11088 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.866244Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:5991f966e1c620a53539eed090211e2de65c815829fd46c887e5079efb4909d3","observation_id":"a077d62c-96f8-46b0-b0c1-5554bd719916","resolution":{"observed_at":"2026-08-01T07:12:16.866244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-01T07:12:16.961984Z","title":"arXiv preprint arXiv:2308.14508 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.961984Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:e3fef7b9efe77446abbd235c363be6f21b6b2d77a47c075b4d0cebec8f2b86c2","observation_id":"b849c910-6f92-4919-b7d6-13fa323e0dbd","resolution":{"observed_at":"2026-08-01T07:12:16.961984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-12T12:34:50.226758Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-01T07:12:17.070993Z","title":"arXiv preprint arXiv:2412.15204 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.070993Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:5408d7d08f3492fe965a11fa7dc12e585a5c3f5b166a1386d1a49ea45ee1194a","observation_id":"9d781903-13b5-4533-9198-444390d591e6","resolution":{"observed_at":"2026-08-01T07:12:17.070993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-01T07:12:17.158490Z","title":"arXiv preprint arXiv:2106.06909 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.158490Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:63239577c5ded3013017cd847144be4d64c432e5d7d026e7b079b48a1732ffa0","observation_id":"ea645a66-611d-4f17-8f19-4fe61d3755fd","resolution":{"observed_at":"2026-08-01T07:12:17.158490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:17.255053Z","title":", booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.255053Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:0be796a807c1a4e4b98c85f869a1de7bc20d19d7d26bde81742e5826d179eef8","observation_id":"b6e0f166-6d11-4580-b458-f1320e3f0227","resolution":{"observed_at":"2026-08-01T07:12:17.255053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:17.414459Z","title":"Proceedings of the 23rd ACM international conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.414459Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4566dabe0e5347692e241778101b88e8c26e0b7116389181d8c32f1773ce2406","observation_id":"8f6cf091-33d3-41e8-8353-c4a1b3287f16","resolution":{"observed_at":"2026-08-01T07:12:17.414459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T07:12:17.523618Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.523618Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:1daa9469fe7dda6b13b1addb7def041c00be0a74e274e9a1e7a6484e12a8c8bb","observation_id":"ff021f35-3403-4f2a-b417-8604fee4d2f8","resolution":{"observed_at":"2026-08-01T07:12:17.523618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:17.561993Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.561993Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2b575a51bc4f3ac75f9bc5818eae5cc8f3a107f28ed232ec01d5e0861d293e39","observation_id":"bb4a6421-3771-41ba-8c79-f93640cae73a","resolution":{"observed_at":"2026-08-01T07:12:17.561993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-16T19:07:23.144895Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-01T07:12:17.564271Z","title":"arXiv preprint arXiv:2011.04006 , year=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.564271Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:9e872a4ece6d5b632c05573ab728599015b0df6b99e8ea0b61528e6943bff8b1","observation_id":"c3ba17b6-882f-4947-a654-8af4a9f0dad9","resolution":{"observed_at":"2026-08-01T07:12:17.564271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-17T00:12:28.494322Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-01T07:12:17.567045Z","title":"arXiv preprint arXiv:2503.03983 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.567045Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:3c61a8876ae67f2ec8056d97e82e4e3e1fd2c2baadf2092a48ab492d5cb0ccc2","observation_id":"ada37a26-5187-4f53-b72a-338eaae07299","resolution":{"observed_at":"2026-08-01T07:12:17.567045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-08-16T15:34:45.261111Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-01T07:12:17.569658Z","title":"arXiv preprint arXiv:2305.04790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.569658Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:45184ef540ff9ee730c0eaab6b3eb44b1b3017cb48bffdca1ddd44879aa1d888","observation_id":"149b6ae8-df44-46f2-b627-27211285b6a6","resolution":{"observed_at":"2026-08-01T07:12:17.569658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:12:17.572218Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.572218Z"},"links":{"citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:4d583ef387e25b51b4d202cfb30efe4c1ec3f7b4a22e7cf4cdad8a1bd5c1f9f7","observation_id":"82a98992-e04b-46ad-8857-1e8923c54ebd","resolution":{"observed_at":"2026-08-01T07:12:17.572218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":233},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 233 outbound references and 0 inbound Pith citation observations for arXiv:2607.21550."}