{"as_of":"2026-08-10T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8820484310d0fad09d24c9f722f0c94b14434e923e131a15a7fd459ef7d5d84c","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:19:33.926800Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21943/citation-record","integrity":"/paper/2607.21943/integrity","json":"/paper/2607.21943/citation-record.json","paper":"/paper/2607.21943"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-01T06:19:31.491739Z","title":"arXiv:2311.07919","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.491739Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:c6ace568149f8e4968a2f799c44793c2a611c6eb5feef0813c172457b5d9a18c","observation_id":"bac90fb4-1169-4c14-806f-bcf450708ada","resolution":{"observed_at":"2026-08-01T06:19:31.491739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:32.061870Z","title":"DOI:10.1038/s42256-020-00257-z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.061870Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:6bf37a2a00d5f6458f1f7eb7379df5d73fcae76097d4a859f972033c1ace7fa0","observation_id":"2329e598-3981-4897-a512-67570bec96af","resolution":{"observed_at":"2026-08-01T06:19:32.061870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-08T14:40:01.471920Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-01T06:19:32.544745Z","title":"InProceedingsoftheInternational Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.544745Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:c268cb5e78b57a24118cfb2a718f4a14a06c1dc6cd08830d72f86e71e782e998","observation_id":"f9308c80-372d-436c-85da-83b247d367a0","resolution":{"observed_at":"2026-08-01T06:19:32.544745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T06:19:32.664754Z","title":"InProceedings of the Inter- national Conference on Learning Representations (ICLR), volume 2025, 84929–84964","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.664754Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:7966139ac9383355eb3aef567d16a98c4d24763ed068f88219290b137140ef22","observation_id":"81c7a2e4-75f7-4b91-926b-24a9a246e60b","resolution":{"observed_at":"2026-08-01T06:19:32.664754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-04T09:41:45.042008Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-01T06:19:33.044773Z","title":"arXiv:2209.15189","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.044773Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:9530c1603032d3e49076ca4005c3eba9a5a55938ad8609ff88799e36568a1f56","observation_id":"e6c8895e-7140-4b0d-9c91-a653f644cb73","resolution":{"observed_at":"2026-08-01T06:19:33.044773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:33.564755Z","title":"InProceedings of the Annual Conference of the International Speech Commu- nication Association (INTERSPEECH), 3754–3758","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.564755Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:75de1c507340c993fb360bdd1d320122aa735896be9d3777e9cb7dc7a77db9c9","observation_id":"1d7d3649-75ec-4377-8aa6-2bdb4a079cc4","resolution":{"observed_at":"2026-08-01T06:19:33.564755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T06:19:33.661907Z","title":"arXiv:2509.17765","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.661907Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:56e7437dff37a25b2ea0ee49e34a8fc9ab4c347f8dcbbf1d3fa30ae509486d66","observation_id":"7b596cc1-0481-4615-bc25-834de344f142","resolution":{"observed_at":"2026-08-01T06:19:33.661907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:33.821036Z","title":"InProceedings of the Annual Meeting of the Association for Computational Linguistics (ACL), 1979–1998","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.821036Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:395ca051a69160c04412c1695ea7c9d1d9c1d8173fa7c7c3997c8e56fc1e7542","observation_id":"4e4da53f-4006-499d-842e-e4785c06da0f","resolution":{"observed_at":"2026-08-01T06:19:33.821036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-02T15:33:37.373792Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06559","snapshot_observed_at":"2026-08-01T06:19:33.926800Z","title":"arXiv:2606.06559","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.926800Z"},"links":{"cited_paper":"/paper/2606.06559","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:b2d5b931e77485217fddba4b05ba0983f3e84469b23d0a2d57429ccb8f41c4a7","observation_id":"6bc1d1a8-3aa3-4c73-9b94-7aa64cc1da89","resolution":{"observed_at":"2026-08-01T06:19:33.926800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:33.354005Z","title":"InProceedings of the International Conference on Learning Representations (ICLR), volume 2024, 16607– 16629","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.354005Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:2bff9545f5947f444e59b8525aa4de2887b5678dc6b10c0f62027210da981645","observation_id":"bfb6310e-03db-464e-92ca-9c3b95e43170","resolution":{"observed_at":"2026-08-01T06:19:33.354005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:31.119543Z","title":"Springer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.119543Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:db54c5fac4d35a6b7831dc9c20bf1ce76c36297c2e4878bab24ab31896d6c917","observation_id":"6e19b0ee-178e-4a38-b9c1-e4147a28eb0f","resolution":{"observed_at":"2026-08-01T06:19:31.119543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-01T06:19:33.244754Z","title":"arXiv:1510.08484","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:33.244754Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:1903a2c339bb243a108ce51c4e6b1b75218e1db7371aff774bc7df691bde841f","observation_id":"4023d0a1-24ef-4957-8522-b17596bca7b9","resolution":{"observed_at":"2026-08-01T06:19:33.244754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:32.186964Z","title":"In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 6904–6913","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.186964Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:f7ae4c96a897d4ca7eaebba868f537f9e472340e74b03ca8e4a19f07de4041d3","observation_id":"441e5737-9cdc-4e86-836a-f6ced4cd9c14","resolution":{"observed_at":"2026-08-01T06:19:32.186964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T06:19:31.674770Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.674770Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:4ef0098a669bddc9c5b33388b9b300e573d0714ea4769c5abc1317310dcb7be9","observation_id":"432e0dbd-1837-496a-b54b-a55e0dda9d31","resolution":{"observed_at":"2026-08-01T06:19:31.674770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:32.911504Z","title":"InProceedings of the Annual Conference of the In- ternational Speech Communication Association (INTER- SPEECH), 2756–2760","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.911504Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:cd302097a3513d5026ef5d3b03701e54f43d9a08dcc8a171d4898dbcce0abe58","observation_id":"7b6d27cd-4300-4469-af01-819a2847d16e","resolution":{"observed_at":"2026-08-01T06:19:32.911504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:31.334755Z","title":"DOI: 10.1109/JSTSP.2022.3188113","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.334755Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:387603508960167b0ed5ca18fced634ef080f261941e7aa9947b338a34eda728","observation_id":"8dec6793-8112-4bb7-9124-d22c4c7b609b","resolution":{"observed_at":"2026-08-01T06:19:31.334755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:30.987089Z","title":"InProceedings of the Annual Conference of the International Speech Com- munication Association (INTERSPEECH), 1983–1987","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:30.987089Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:2f31ee3847dc04f5da4959475a2ad870346ff7f40dfeb2ed97067bc3e9efee29","observation_id":"32b2485b-8812-424b-a8d5-53c300c1bb1d","resolution":{"observed_at":"2026-08-01T06:19:30.987089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T06:19:32.754751Z","title":"arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.754751Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:eb3644546f75318eb2a353f312c9111b7c1fd7d6c2d9ab220aa3595d78fa8010","observation_id":"b7d6eea6-229f-466a-ab8f-780b4ceeee89","resolution":{"observed_at":"2026-08-01T06:19:32.754751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:19:32.354752Z","title":"arXiv:2510.24821","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:32.354752Z"},"links":{"citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:a631dc2f54ccf689730db136db1e5c5328e0dba4527fd26a51c54e4bdd111763","observation_id":"3ec5dbe5-adf1-4afc-9851-636b61d723ae","resolution":{"observed_at":"2026-08-01T06:19:32.354752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-01T06:19:31.834213Z","title":"arXiv:2604.27393","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T06:19:31.834213Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2607.21943"},"observation_digest":"sha256:207a9881798eda8b2cc7ba50dc1b4541ad28515e5d4c88d2f239d385c94044ec","observation_id":"836bde2c-c03e-4656-86fd-ff08ff939653","resolution":{"observed_at":"2026-08-01T06:19:31.834213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21943","last_updated":"2026-07-29T05:22:33Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T17:51:18.648914Z","submitted_at":"2026-07-24T03:39:34Z","title":"Listen, Do Not Copy: Internalizing Audio-Grounded Scaffold Context for Robust Omni-Model Speech Understanding"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.21943."}