{"as_of":"2026-08-13T08:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:662923dade7105599156935f845d26b5d5e4ee1f490370c85768f6456e5ee899","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:33:55.288126Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08067/citation-record","integrity":"/paper/2608.08067/integrity","json":"/paper/2608.08067/citation-record.json","paper":"/paper/2608.08067"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.203485Z","title":"arXiv preprint arXiv:2509.12508 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.203485Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:d5b30680f78d3b89253517ef3f9223eb17ec4f92f6316e9f9c105951b931df96","observation_id":"bfec3e00-e796-406a-a40e-058c645abc9b","resolution":{"observed_at":"2026-08-12T00:33:55.203485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.207732Z","title":"arXiv preprint arXiv:2509.22727 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.207732Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:03219cc15b6f6c39ce658af920df537caf3938506c9cf2292d7a4683504e768f","observation_id":"af35aa75-a3a9-409b-b5a1-59d5a5b76262","resolution":{"observed_at":"2026-08-12T00:33:55.207732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-08-11T08:01:37.262348Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-12T00:33:55.211399Z","title":"arXiv preprint arXiv:2604.27393 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.211399Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:35613e06f5551acc94118986ae2c212cb2cc84dd1c7f8e6bde23ee1feeacc6ec","observation_id":"97f4150d-0dd0-44b8-bb7b-047440424528","resolution":{"observed_at":"2026-08-12T00:33:55.211399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.215488Z","title":"In: ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.215488Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:b0c30b2f17afa4bd50a988957080df700a316337106b36bfbd9a3412537572e0","observation_id":"200fa976-1e40-486f-a181-b679605b507b","resolution":{"observed_at":"2026-08-12T00:33:55.215488Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-12T00:33:55.219847Z","title":"arXiv preprint arXiv:2410.00037 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.219847Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:46c01c5fef6cfa7927d5cc269a5fa6895d5d38744f99effb216a7d90c09645d8","observation_id":"d4013e7a-d846-4835-ba93-cafe56731c97","resolution":{"observed_at":"2026-08-12T00:33:55.219847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-12T00:33:55.224384Z","title":"arXiv preprint arXiv:2504.18425 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.224384Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:5b1baf7b4e1b8ef0c39242fba0e0ebf7f61964673ca23304bdb63d282613047e","observation_id":"4ea41276-3ab0-4160-b57d-4a5f95c50811","resolution":{"observed_at":"2026-08-12T00:33:55.224384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-12T00:33:55.228960Z","title":"arXiv preprint arXiv:2412.10117 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.228960Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:081629ba0aea83fb5e1473b2f29c103ef0d27abd030bea01728104a2b49986c6","observation_id":"60815fdb-f522-4f01-84dc-8d8f7a04abb2","resolution":{"observed_at":"2026-08-12T00:33:55.228960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.862029Z","title":"In: International Conference on Learning Representations","venue":null,"work_id":"bcac155a-809e-439e-be85-843383fd9e50","year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.232967Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:f3418c3b0831f0c3a8f58cd805a36cea9656551c0ac30c1e1133d57384442c79","observation_id":"d4c29cde-fb73-444f-aaa9-d1428a2a8819","resolution":{"observed_at":"2026-08-12T00:33:55.866459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i37.40429","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.333801Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence40, 31627– 31635 (Mar 2026).https://doi.org/10.1609/aaai.v40i37.40429","venue":null,"work_id":"420b9e47-7b9c-4fc4-b4f9-44f1183f0013","year":2026},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.235952Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:b72c8eba43e92e74d365ec75ba834b630fc1e16693cb3888c49394aa6fe5a2f4","observation_id":"1a96edab-e63f-4207-9307-e4acc974e0e7","resolution":{"observed_at":"2026-08-12T00:33:55.339379Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T00:33:55.239061Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.239061Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:0b9a7b8c49ff12b1b54eb3a9036f58440facd8444e59c743e10dafe444b12dbd","observation_id":"a4b2af8b-8382-42fe-b922-fc84c899a034","resolution":{"observed_at":"2026-08-12T00:33:55.239061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.849767Z","title":"In: SC20: international conference for high performance computing, networking, storage and analysis","venue":null,"work_id":"629aff48-64b9-433b-9be1-90749661f9cb","year":2020},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.242230Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:994c5d8b555bcbaef3dbbd6784ac0c7b185a406b6c4f6aa64c53e728aa9602df","observation_id":"4d6f9104-32ed-4db6-8084-74f12415beea","resolution":{"observed_at":"2026-08-12T00:33:55.853967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.245198Z","title":"In: Proceed- ings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.245198Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:354f7a1a71eac2443cc4b0e41ad2e74963331e6d5faf75b701d85e83aeddb127","observation_id":"efa11eb2-c6d0-42ce-855f-7586535084cf","resolution":{"observed_at":"2026-08-12T00:33:55.245198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.248308Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.248308Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:e789b70b0d69888af71d22d3c26430e95a4c25e7c4a82c88f512098378e67d00","observation_id":"6bcb7b3d-2913-490a-b2e7-5baeaf936945","resolution":{"observed_at":"2026-08-12T00:33:55.248308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-12T17:41:33.288472Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-12T00:33:55.251451Z","title":"arXiv preprint arXiv:2505.02707 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.251451Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:952a5938c988fd273f46b29892e40150d8b366c908a4ec8b13331a673ce72202","observation_id":"97497c93-ea4a-4ecd-b488-ea0dfa8c8a84","resolution":{"observed_at":"2026-08-12T00:33:55.251451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.831246Z","title":"Shu et al","venue":null,"work_id":"a7516d24-6f66-47ed-8361-bec9b2db7ead","year":2021},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.254938Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:96b137f5071b1a56df3372a732c4606016a153c6a6c459e17c090e99adacd490","observation_id":"e7814735-ac0f-48ae-8d53-84db3da3f315","resolution":{"observed_at":"2026-08-12T00:33:55.834988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.258278Z","title":"arXiv preprint arXiv:2511.15848 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.258278Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:60f5db8d060dbe34d54be7580507da328f88b5c004125531766329183f7f5074","observation_id":"cf630a7e-0095-48bc-8e8f-3b22c886bd23","resolution":{"observed_at":"2026-08-12T00:33:55.258278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.819997Z","title":"In: Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: System Demonstrations","venue":null,"work_id":"f9654322-7a02-4abf-af83-0e00b540d968","year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.261622Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:153f2c7d6a51f3fe38286c1e165efec620677dec46af6774244ba4e3366fd2c8","observation_id":"8cb1243f-a25c-4aee-a581-73a6b85021d9","resolution":{"observed_at":"2026-08-12T00:33:55.824173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-12T00:33:55.264846Z","title":"arXiv preprint arXiv:2507.16632 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.264846Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:4b2d68f6ecdd20b898d8e0da8f70e02f6e435ce7ca7e22185054d35b7a46fca9","observation_id":"1eeb2fa5-51fe-4bc6-848d-7cab782ed022","resolution":{"observed_at":"2026-08-12T00:33:55.264846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-12T00:33:55.268346Z","title":"arXiv preprint arXiv:2503.20215 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.268346Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:70cb504b1d1fdba2d2e84e30871a0c5cd024800e753aad16cee645f661b05b54","observation_id":"8f00c36c-71ac-40ff-8c5e-6f0b1e3bedcc","resolution":{"observed_at":"2026-08-12T00:33:55.268346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-12T00:33:55.271928Z","title":"arXiv preprint arXiv:2509.17765 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.271928Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:0343ffed9e8943c2cc3a376d701fbe527cb2ba6148c3b038dd60512a93b89200","observation_id":"06de46fe-f455-487e-98d0-2453476583d0","resolution":{"observed_at":"2026-08-12T00:33:55.271928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:33:55.276428Z","title":"arXiv preprint arXiv:2603.10420 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.276428Z"},"links":{"citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:9158a340df95f4b63442721169411522a7528bcad5dd64bb21328ae073307acb","observation_id":"be9c1c1d-ba22-469e-8519-d2aa8261732f","resolution":{"observed_at":"2026-08-12T00:33:55.276428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T00:33:55.279827Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.279827Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:8558d28cb08d3322571b2a1716da8bc208ae8d1a1ac1de4e292cfe6b4b04f4d9","observation_id":"ecb014c2-2379-4070-8554-663f4e7325d7","resolution":{"observed_at":"2026-08-12T00:33:55.279827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-12T00:33:55.283870Z","title":"arXiv preprintarXiv:2412.02612(2024).https://doi.org/10.48550/arXiv.2412.02612","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.283870Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:5a8f3a863d6cb9847d2ed3d8e126891f2f562f8b8eab01ed8850047756a8e0c5","observation_id":"c648a9b2-30be-496d-9dd7-ddc0d543d6e7","resolution":{"observed_at":"2026-08-12T00:33:55.283870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09174","last_updated":"2025-09-11T06:17:59Z","snapshot_observed_at":"2026-08-12T16:29:27.032616Z","submitted_at":"2025-09-11T06:17:59Z","title":"EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs","version":1},"cited_work":{"arxiv_id":"2509.09174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.09174","snapshot_observed_at":"2026-08-12T00:33:55.349765Z","title":"EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs","venue":"cs.CL","work_id":"b2c460aa-4384-46e4-9d85-f0a179a7b9b7","year":2025},"citing_paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:55.288126Z"},"links":{"cited_paper":"/paper/2509.09174","citing_paper":"/paper/2608.08067"},"observation_digest":"sha256:90b354f3a81f978903f07f091de5b9dae9fdcfc8a62a1c59123bfa1c77c8611f","observation_id":"fc5570f9-6f3e-4de1-a5c6-7576b8b645f1","resolution":{"observed_at":"2026-08-12T00:33:55.353666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08067","last_updated":"2026-08-08T11:11:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T08:11:50.703502Z","submitted_at":"2026-08-08T11:11:10Z","title":"DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.08067."}