{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70b8f8f0ff72acfef6f16dfc8748c35a1cd1265bd2592de2b373fe706d28644b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:50:04.331322Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:06:43.144630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:f80b935f2f3deb191aaaddbeef12628183eb4b29519abd66db4276231d34a6b6","observation_id":"d50d2668-13ce-4769-ab2f-1f23653570c2","resolution":{"observed_at":"2026-06-28T17:52:27.034536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.05911","last_updated":"2026-06-04T09:16:26Z","snapshot_observed_at":"2026-08-06T13:48:13.385785Z","submitted_at":"2026-06-04T09:16:26Z","title":"DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T23:49:05.871422Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.05911"},"observation_digest":"sha256:c8016748bb17b906bbdf0cbab29f4b38f8006560783b91dda56a4f19f0b827a5","observation_id":"0bfbeeef-bea8-4266-87cb-a94e28ad5ad6","resolution":{"observed_at":"2026-07-02T15:37:06.111137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":"2507.17563","doi":"10.48550/arxiv.2507.17563","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Boss: Beyond-semantic speech,","venue":"ArXiv.org","work_id":"03af9241-116d-4c15-87e2-b24d3bd9bb3f","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:8e52881193149f9088225cb9387e7d1cf1559c564d29d2c24bf5c37d1a93650d","observation_id":"b9ee2352-bbe0-4f44-af84-1d529dd38a98","resolution":{"observed_at":"2026-06-30T22:15:05.252383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17563","snapshot_observed_at":"2026-07-31T23:06:43.144630Z","title":"Boss: Beyond-semantic speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24082","last_updated":"2026-07-27T07:23:22Z","snapshot_observed_at":"2026-08-06T03:54:26.893671Z","submitted_at":"2026-07-27T07:23:22Z","title":"Towards High-Level Semantic Intelligence","version":1},"reference_index":236,"source":"pdf_text","source_observed_at":"2026-07-31T23:06:43.144630Z"},"links":{"cited_paper":"/paper/2507.17563","citing_paper":"/paper/2607.24082"},"observation_digest":"sha256:e8b06c39a0318aa750bc6c644bd3b3368287171a4f927711688f82dba3ff9ad4","observation_id":"54a1eb9f-62df-4ce3-b53c-0390882d0a03","resolution":{"observed_at":"2026-07-31T23:06:43.144630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17563/citation-record","integrity":"/paper/2507.17563/integrity","json":"/paper/2507.17563/citation-record.json","paper":"/paper/2507.17563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.923155Z","title":"SAE International, Warrendale, PA (2021)","venue":null,"work_id":"8749ce7a-f693-420a-b0eb-3e5c62c3b052","year":2021},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.155586Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:8fb1b747302ddd8689c351941087ee6f8cf51561bd431fad45b37737ce15451b","observation_id":"144efdf1-5336-4413-ad50-a9de1feb330c","resolution":{"observed_at":"2026-08-06T14:50:04.926040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.916272Z","title":"The philosophical review 66(3), 377–388 (1957)","venue":null,"work_id":"bef87704-2723-4681-9c96-9ec03241317b","year":1957},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.159782Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:468b782e5da657f5cd1b26bea17283d7d20558e764e7431ddf625eb24c61301f","observation_id":"81d6b79e-51ec-4c40-9e9e-1beee426e510","resolution":{"observed_at":"2026-08-06T14:50:04.918804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.909353Z","title":"Wadsworth, Belmont, CA (1971)","venue":null,"work_id":"902e36b0-1429-4252-bb03-a7a7bd8dd062","year":1971},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.162719Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:8a8e43c7a5e16ba84937c10c72d16994e7566bc8d72c21e55a358ec337d5ef08","observation_id":"e9b7cf0f-03a1-42b4-a1e2-57a6d5d236f8","resolution":{"observed_at":"2026-08-06T14:50:04.911798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.902391Z","title":"The body as a medium of expression 162, 174 (1975) 19","venue":null,"work_id":"6e097f32-93be-4a47-a8a6-38d13c227050","year":1975},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.165477Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:5e126ce00ce40d4c75a39774c4453a37faf1d333be3cbabae62517f54a63093c","observation_id":"e3d1a037-9ff5-4002-a459-175dbb11e27c","resolution":{"observed_at":"2026-08-06T14:50:04.904816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.895457Z","title":null,"venue":null,"work_id":"7e313dad-4871-4aee-a927-951831ba53e3","year":1958},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.168918Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:3f448c7f8e9450e69b52c29bd81d811c2d45dd0804cd0df22fbbe333b28f64c5","observation_id":"9d2eba4a-2b0f-4783-aa85-40ff6944a0fb","resolution":{"observed_at":"2026-08-06T14:50:04.897921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.888379Z","title":null,"venue":null,"work_id":"c7d32b2c-eb35-4ba9-b169-ccfa0d1174ca","year":1969},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.171999Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:fc11a5c23fc7997d8edadb5face3293164c6b53300a68c5e9c0792093698995b","observation_id":"50bd445d-fe5d-4c82-b6f1-326b72570dae","resolution":{"observed_at":"2026-08-06T14:50:04.890956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.880362Z","title":"Syntax and semantics 3, 43–58 (1975)","venue":null,"work_id":"2cc0f6ae-8285-4e85-b0fd-1c2c02e336cb","year":1975},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.175090Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:48b0e9721f58c4866b69541ea6a4a783b1bd55cf32a206a9cf1f0e10625fbc4f","observation_id":"fdbe0d7e-b146-41dc-bdf3-901bcfdab278","resolution":{"observed_at":"2026-08-06T14:50:04.882544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.873429Z","title":"PhD thesis, Massachusetts Institute of Technology (1980)","venue":null,"work_id":"100f26dd-e1a2-4348-a356-653dd5773834","year":1980},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.177998Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:d836dc84197811a43d759b232f99e25c0bbcfe0d2bdd1e47c5389d0556311bc8","observation_id":"f2a3a8fa-b164-46e8-afbc-7a3b37acd4cc","resolution":{"observed_at":"2026-08-06T14:50:04.875980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.866537Z","title":"Language and speech40(2), 141–201 (1997)","venue":null,"work_id":"2175012b-e01b-4fc9-8290-9b926be23fc0","year":1997},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.180588Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:bd54129dd67b6bd8b10a178e46b5b04eb9a54c27e20f09417d853a4eb3b406a6","observation_id":"582a3f9b-fa91-4895-ae16-8b6927b2f2c7","resolution":{"observed_at":"2026-08-06T14:50:04.869014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.859421Z","title":"Harvard University Press, Cambridge, MA (1986)","venue":null,"work_id":"05bc2ae3-0ee7-401c-a3fb-f8abfde908e7","year":1986},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.183025Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:715a1717c6fcbf1402d313dcb45cb91a82e6fac655c6d73be4241840dc364817","observation_id":"15a45424-9b7f-4f36-bec6-2356c198d9a0","resolution":{"observed_at":"2026-08-06T14:50:04.862013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.852983Z","title":"MIT press, Cambridge, MA (2000)","venue":null,"work_id":"78ba2033-8629-4c70-80e6-3d5bea989691","year":2000},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.186272Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:74b219e75eb057eb344dbdb70bf313fd9097e19c9dfcda31197c3ceb0b91b5b4","observation_id":"e6b51073-a067-4d0c-81a6-e7a321f40643","resolution":{"observed_at":"2026-08-06T14:50:04.855343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.843696Z","title":"Computer Speech & Language 27(1), 4–39 (2013)","venue":null,"work_id":"871cb691-44ac-4c35-b746-75739969c3af","year":2013},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.189035Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:72445be89ff3c07e307f39e2cff99d76540f4d2032026fa7272101f97ebc37fd","observation_id":"7c614a42-538a-4298-be80-2c79a3bea31f","resolution":{"observed_at":"2026-08-06T14:50:04.846829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.836914Z","title":"In: International Conference on Machine Learning (2022)","venue":null,"work_id":"fe714d70-22a8-4b6a-878b-e3d2bf89746c","year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.191519Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:fc264b0d733722a0fdd9fcb4ee7243b557f61669db1e87cffbaf350107b4bbf4","observation_id":"a30b930e-7837-47c9-8494-cd72aae9fd1b","resolution":{"observed_at":"2026-08-06T14:50:04.839461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19269","last_updated":"2023-05-30T17:59:26Z","snapshot_observed_at":"2026-08-06T18:04:17.368236Z","submitted_at":"2023-05-30T17:59:26Z","title":"Make-A-Voice: Unified Voice Synthesis With Discrete Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19269","snapshot_observed_at":"2026-08-06T14:50:04.194224Z","title":"ArXiv abs/2305.19269 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.194224Z"},"links":{"cited_paper":"/paper/2305.19269","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:06463a66f3d050882bdfd8ea4e0a70a43ea24fb2eb58b76083f8655272b8e0e6","observation_id":"2ff3d354-6a17-4261-a3a8-75bc2856df60","resolution":{"observed_at":"2026-08-06T14:50:04.194224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T14:50:04.197119Z","title":"ArXiv abs/2411.01156 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.197119Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:c2e4bdf66ed19ee2b5cda23ee068548390bebb14bcb8b4c277eb9c93bb7faf24","observation_id":"f5804bb3-fddd-4e20-a57e-7810b4c9c2af","resolution":{"observed_at":"2026-08-06T14:50:04.197119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T14:50:04.199707Z","title":"ArXiv abs/2310.00704 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.199707Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:dcbcb077a4cc9c179bd37e7a65efaf4bd7aa217e7d58a5852c8bd83e63d6e68a","observation_id":"8ff6b37b-4359-4374-8562-1d9f47b94cca","resolution":{"observed_at":"2026-08-06T14:50:04.199707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.828332Z","title":"In: Annual Meeting of the Association for Computational Linguistics (2024)","venue":null,"work_id":"5e93587b-45fc-4d63-95a1-64375705f13c","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.202392Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:a178eb5536a81695ab89717a4559b88aca6fd4ccfbaaf3b43476bdf6f01a45f7","observation_id":"9ef71935-49fd-494b-96e9-b3f7f0eeedb8","resolution":{"observed_at":"2026-08-06T14:50:04.831208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.820161Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 11341–11345 (2023) 20","venue":null,"work_id":"ef15cf50-78da-4e29-b546-a5a34ea3e059","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.204734Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:a8483bdf9caf10d4ddeedd157db47965bbba9bf8c7d43d8135c48584ab6e8a8a","observation_id":"cd577069-11ce-417f-ba83-147b3cf2a151","resolution":{"observed_at":"2026-08-06T14:50:04.822907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T14:50:04.208123Z","title":"ArXiv abs/2406.02430 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.208123Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:429d5ec95b603692df31ea431eed79343a162e3fe3fcbfb645df6d2540f3ce6c","observation_id":"be7f1afa-59f8-436c-94e5-b0b99ba1b117","resolution":{"observed_at":"2026-08-06T14:50:04.208123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T14:50:04.211687Z","title":"ArXiv abs/2410.06885 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.211687Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:b5adb9f07c366b7f470c39dff482e7aedc829242b24dd39601285866268a0bc5","observation_id":"16cf8ede-836a-4fc0-a25f-fed09d5b15d8","resolution":{"observed_at":"2026-08-06T14:50:04.211687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-07-06T17:24:41.012207Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T14:50:04.214444Z","title":"ArXiv abs/2402.01912 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.214444Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:541e849d2eb07c865b1ba1504257f4c6f09af308b7228af61dc099fae2fd50f6","observation_id":"aea71d72-4db1-4369-9af7-bc31544e2993","resolution":{"observed_at":"2026-08-06T14:50:04.214444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T14:50:04.217789Z","title":"ArXiv abs/2301.11325 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.217789Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7eca75d7581c2b3e6bc1c38a0409492547f0c63824fc2416f60b3d1ed4113d14","observation_id":"4bfbdca1-ddcf-452a-8f25-bb52088e1373","resolution":{"observed_at":"2026-08-06T14:50:04.217789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.812969Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 31, 1720–1733 (2022)","venue":null,"work_id":"9e986a33-829a-4a35-abe2-32869a5e01e1","year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.221317Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:6396e3f43157c670f67ecb8d504aca0e7a4af5b130f08a9ecf28d48c4b120d52","observation_id":"dfa9b936-8c72-4570-aed2-0cbf35b50e21","resolution":{"observed_at":"2026-08-06T14:50:04.815746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T14:50:04.223838Z","title":"ArXiv abs/2312.15185 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.223838Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:c8621c0a9551d10c7b250ef3f353bc087e04766683bcdccd0560724d6c4e667b","observation_id":"f780c7fd-ff9e-48e9-abaf-946cd67323b8","resolution":{"observed_at":"2026-08-06T14:50:04.223838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-06T14:50:04.227252Z","title":"ArXiv abs/2308.16692 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.227252Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:de2a21269be54b546b0d45d5cd205a9c7d3689cd50c0397b607c16e9ded11aad","observation_id":"47d3455b-71bd-4369-ac2b-a73a517a9c6c","resolution":{"observed_at":"2026-08-06T14:50:04.227252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T14:50:04.231008Z","title":"ArXiv abs/2310.13289 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.231008Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:c95c196016727783d1264594757f620bbb53131355da37d712576e7e30fbc8f6","observation_id":"ed01461a-ad74-4d8f-88af-523974785d7c","resolution":{"observed_at":"2026-08-06T14:50:04.231008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-04T09:21:35.342211Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-08-06T14:50:04.234259Z","title":"ArXiv abs/2304.12995 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.234259Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:f90bee7000929d33d171149e78653288a9faec1dca282d9d5b9856f34dd4a15c","observation_id":"8ba8c8cd-b93f-40a6-aff1-73af69f6d99b","resolution":{"observed_at":"2026-08-06T14:50:04.234259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T14:50:04.237904Z","title":"ArXiv abs/2305.06355 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.237904Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:aeda06ac19e824557110e3159c649fdcb10599091b6635f6ceaf06c84e337fab","observation_id":"19a71ef7-81d6-4628-b705-b012d9329c01","resolution":{"observed_at":"2026-08-06T14:50:04.237904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T14:50:04.241511Z","title":"ArXiv abs/2306.12925 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.241511Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:cc232d9cc725bb9dcf779b63ba92f8ac57b53f7d579765a4e7ec1d86c1eb8483","observation_id":"78ff2eb6-73a7-4078-b11a-27ce9f872942","resolution":{"observed_at":"2026-08-06T14:50:04.241511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.803780Z","title":"2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), 1–8 (2023)","venue":null,"work_id":"b8db8790-7009-4767-8b57-87f9ce288189","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.244219Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:a57bcb21f1ed627ff18d762ef6cfb7e74b62ff4d1fddc2e9443676e8e712a123","observation_id":"1cde944a-8303-4aff-b4a3-f702f09b7c88","resolution":{"observed_at":"2026-08-06T14:50:04.808123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-06T14:50:04.247739Z","title":"ArXiv abs/2310.04673 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.247739Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:54e16109ac4cad6f9ac1708d6d97560951ffd6b9bad999719ccbac96cdcd8ba0","observation_id":"1dc0d152-f8f7-4e86-bc7e-a8fbaa3b0b19","resolution":{"observed_at":"2026-08-06T14:50:04.247739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.796149Z","title":"In: Conference on Empirical Methods in Natural Language Processing (2024)","venue":null,"work_id":"e950e689-f6e4-4846-888b-c20c6ab195ae","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.251222Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:f4a03b78a44aab581edf6eb32166ba0d660ce9c253140a99f4d370ab6b64fb60","observation_id":"7f022cd7-28ef-47ee-b047-348f9003a2d8","resolution":{"observed_at":"2026-08-06T14:50:04.799006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T14:50:04.254194Z","title":"ArXiv abs/2406.11768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.254194Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:3d44e7b8f4598fb3bdc769256a23a07069e2565f7ca247ae1d6a14a936c8d8e8","observation_id":"97846861-2b18-4eba-a1bd-0d568262121a","resolution":{"observed_at":"2026-08-06T14:50:04.254194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-06T16:36:54.608548Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-06T14:50:04.257799Z","title":"ArXiv abs/2402.01831 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.257799Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9836b8ee537a6c4be23d948bff2859789c868e5ff0d10debc519bffc697f95ad","observation_id":"6ca1a476-2bc3-4290-8e2c-f0eb071a36ca","resolution":{"observed_at":"2026-08-06T14:50:04.257799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-06T13:40:30.194505Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-06T14:50:04.261844Z","title":"ArXiv abs/2503.03983 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.261844Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:646da54c749dcbc2262ede694894400ef57a7f586eedfa06aefd306fab212fc3","observation_id":"790b06dd-25e5-44b1-8942-25f3c8f43102","resolution":{"observed_at":"2026-08-06T14:50:04.261844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.264610Z","title":"ArXiv abs/2503.02318 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.264610Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:fc57f4dd3c234f99f755584474e0f99e542b25c99258f9bee01a9aac82878927","observation_id":"cc5371a5-38ec-4876-a922-c91115530337","resolution":{"observed_at":"2026-08-06T14:50:04.264610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.788014Z","title":"In: North American Chapter of the Association for Computational Linguistics (2024)","venue":null,"work_id":"503a1ff6-8a67-4e28-9e09-69a7b9cd8cbf","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.267756Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:3ed091ddc56ad6b3096d2b3f3c2e6e2063a893ff33865a0c028c89f3d5e1efa1","observation_id":"b076e571-fa30-4a86-a5a4-0615a155e7f2","resolution":{"observed_at":"2026-08-06T14:50:04.790960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.778374Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 12136–12140 (2023)","venue":null,"work_id":"49771e4f-c9cf-4ebf-9831-c39dbee143c1","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.270945Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:834b4dd73c685d3158feb9efe3a27073a7ef9a67fd215f452c56330fcfd0024d","observation_id":"3d94390d-76b0-4ab0-91b8-5a107de7e782","resolution":{"observed_at":"2026-08-06T14:50:04.781637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.768094Z","title":"In: Annual Meeting of the Association for Computational Linguistics (2024)","venue":null,"work_id":"112043de-a3ca-4d5c-aa16-8dd78e7c33d0","year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.273350Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:27c1556695c7ce577cacb09e44699fc23b8635b0b4541cf410380ab05dbcadd5","observation_id":"f06420fe-ae72-42c5-8412-8f6c1b7206d4","resolution":{"observed_at":"2026-08-06T14:50:04.771636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.758609Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing 31, 775–788 (2023)","venue":null,"work_id":"5a643af0-7960-43a5-bea8-436521d50c41","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.275886Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2ac7a2709de8a8b9a53761e5b1bd403c2820c944e107fa2e6e8c8b41eb6789b1","observation_id":"0047cc10-8a7b-4551-9b15-aa53afb609fa","resolution":{"observed_at":"2026-08-06T14:50:04.762026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T14:50:04.278940Z","title":"ArXiv abs/2311.07919 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.278940Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:482c283987d60ddb9189ce03e2fff5973b5afeb537440b0fd7970132f073eef9","observation_id":"0ba5a472-a878-48d0-8d0e-de619200d9ed","resolution":{"observed_at":"2026-08-06T14:50:04.278940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T14:50:04.281604Z","title":"ArXiv abs/2407.10759 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.281604Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:090e1c7d76fbfcc6ef71a939660d10bb003988834ad9eeab37499ac7113bdc24","observation_id":"d41018c7-7871-4f49-bd03-8065e8646b61","resolution":{"observed_at":"2026-08-06T14:50:04.281604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.749575Z","title":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 10316–10320 (2023)","venue":null,"work_id":"7da36a9a-c882-4a2d-8299-fa8843d796ce","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.284304Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:168ff54b8d34dabdce5b033f25ed819c6d21f832068eddd7e074fec18eff89e1","observation_id":"c9aacbf8-7d49-4efc-b8c9-e3d305dd46fb","resolution":{"observed_at":"2026-08-06T14:50:04.752715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.738706Z","title":"2024 IEEE 14th International Symposium on Chinese Spoken Language Processing (ISCSLP), 586–590 (2023)","venue":null,"work_id":"ac2e0ce9-dd4d-4879-a5f3-c8a94a771567","year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.287643Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:e68711d8e579e559e8c0d3896b4f6717874ff579f930e714468f76f8c8ec7005","observation_id":"d97d9af7-4d15-47dc-931b-30a37b2cc3e2","resolution":{"observed_at":"2026-08-06T14:50:04.742200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:50:04.291383Z","title":"ArXiv abs/2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.291383Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:27d724c41cbda5679b120cdc3b599306024cd849f0a3f15701652fbd5a010216","observation_id":"275754a4-9a8c-48fc-8896-d67dea81c1d9","resolution":{"observed_at":"2026-08-06T14:50:04.291383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-06T14:50:04.294343Z","title":"arXiv preprint arXiv:2412.02612 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.294343Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:c6d91eb7bacb48f1d7a5bd4ea471562163139192a36a81eaa16d65f6347d191d","observation_id":"134ce70d-1692-43cd-9080-f731de608cff","resolution":{"observed_at":"2026-08-06T14:50:04.294343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T14:50:04.298059Z","title":"arXiv preprint arXiv:2408.01800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.298059Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0d975909513d97ce1fd42f889338cdd3a149e057b6cec69b153f0718754c5559","observation_id":"91a32126-e326-4141-9b4a-581e26e943c1","resolution":{"observed_at":"2026-08-06T14:50:04.298059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.300962Z","title":"arXiv preprint arXiv:2501.15368 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.300962Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:f7074d5a2062ad1b369fb96058c3d20b228852051c821e632886b4b9ced4f544","observation_id":"37aa05cf-a5eb-46f2-b9e6-a44c247380a8","resolution":{"observed_at":"2026-08-06T14:50:04.300962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.730814Z","title":"GitHub (2025)","venue":null,"work_id":"c3a9269a-2a4c-43ef-a348-eb95c106f623","year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.303746Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:8892753527d8e01d4717b53ec596cf6b70b1284ec22f43641706ef2ce3c23449","observation_id":"7faffdba-969d-44c7-8bf5-06c027f5df08","resolution":{"observed_at":"2026-08-06T14:50:04.733609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T14:50:04.306448Z","title":"arXiv preprint arXiv:2411.00774 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.306448Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2414a5c286995a3f1129fbde9a3cc8accb63bf158efec9796ee73447141c0371","observation_id":"9411af84-8233-4e5b-af70-fcd682a869a0","resolution":{"observed_at":"2026-08-06T14:50:04.306448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T14:50:04.310026Z","title":"5-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.310026Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:2142e51eabc86e3986c9572399eac26e17e8bb3bbfd7719b76fff03f7c6aa509","observation_id":"2c5d77d4-6657-4926-9681-09065d3c91de","resolution":{"observed_at":"2026-08-06T14:50:04.310026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-06T14:50:04.312753Z","title":"arXiv preprint arXiv:2504.18425 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.312753Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:268ff6afcf65b407b675a7d328a371d07c659bff6093597b9e4020fc3a213e7c","observation_id":"528c4e6b-c8c1-47ad-bd4c-5c83c30d74bc","resolution":{"observed_at":"2026-08-06T14:50:04.312753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-07-06T12:55:09.694305Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-08-06T14:50:04.315499Z","title":"arXiv preprint arXiv:2203.16844 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.315499Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:e022b328194ad24fa37dc0830f223ec05aa7fb480db97669f3dd6602e70041d1","observation_id":"b8e85c11-7a2f-49b9-a68b-6864ce52396e","resolution":{"observed_at":"2026-08-06T14:50:04.315499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-04T13:52:59.504745Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04962","snapshot_observed_at":"2026-08-06T14:50:04.318974Z","title":"arXiv preprint arXiv:2501.04962 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.318974Z"},"links":{"cited_paper":"/paper/2501.04962","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:ed7272737b3b127d6ae7d6ce3c1b8fe4850e3577d8ffc6654529dd777f66193d","observation_id":"a829bc1c-343f-4a9a-a9f3-66f18d204e8a","resolution":{"observed_at":"2026-08-06T14:50:04.318974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12339","last_updated":"2025-05-28T14:24:12Z","snapshot_observed_at":"2026-08-01T16:33:39.409483Z","submitted_at":"2025-04-15T01:44:56Z","title":"GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM","version":2},"cited_work":{"arxiv_id":"2504.12339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12339","snapshot_observed_at":"2026-08-06T14:50:04.360551Z","title":"GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM","venue":"cs.CL","work_id":"7213bc2c-dc82-4709-9218-0d18cae35692","year":2025},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.322306Z"},"links":{"cited_paper":"/paper/2504.12339","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:991288e1fef4b2b846505da37cdbc0a8c7ed2b62ee2b564a23d894533f06c713","observation_id":"dc44700a-2646-4892-aca5-e51cb3dbce49","resolution":{"observed_at":"2026-08-06T14:50:04.365397Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-06T14:50:04.324971Z","title":"arXiv preprint arXiv:2310.11230 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.324971Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:a534641b8b1417556836315332dec6135cd95e6047e35c988152b61f7d68bb46","observation_id":"a022cac8-8adc-4ed1-b89f-2c25917be940","resolution":{"observed_at":"2026-08-06T14:50:04.324971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.721838Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"c5a07248-6def-4002-b2f5-9c1819ff0a76","year":2018},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.328064Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0ee8c0d3129e00cd69c004b0ccca7cef6ae6fbef2567042817a372094dc16c8a","observation_id":"6ce36a8f-ad4a-449a-86f3-944a0b06a97e","resolution":{"observed_at":"2026-08-06T14:50:04.724655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:50:04.712280Z","title":"IEEE Signal processing magazine 18(1), 32–80 (2001) 24","venue":null,"work_id":"bd82ae70-91cb-4f63-8383-e6432b7c6865","year":2001},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.331322Z"},"links":{"citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:e72819c63fea83acdedbce6de6893ddb0ab411b0c7521d3a3603199471086d95","observation_id":"c829955e-8240-4c2b-965e-400c39a0a1fe","resolution":{"observed_at":"2026-08-06T14:50:04.715667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T03:22:50.485332Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2507.17563."}