{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:576d0cb10692573b5647ba5824cbc2110c968e7575ae794383a30911db39db61","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:30:12.153813Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01119/citation-record","integrity":"/paper/2608.01119/integrity","json":"/paper/2608.01119/citation-record.json","paper":"/paper/2608.01119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T00:30:10.752328Z","title":"Moshi: a speech-text foundation model for real-time dialogue.arXiv preprint arXiv:2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.752328Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:23e2bab77b79f19e95fcb5311e6291e669bb1eb20e71ed16d6f76b3eb18bb978","observation_id":"c6ef395f-e37d-4481-a367-8fab8f7e00e2","resolution":{"observed_at":"2026-08-06T00:30:10.752328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T00:30:10.821180Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm.arXiv preprint arXiv:2411.00774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.821180Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:563d2fc59b33e510c41ff4173be5ac4488aa82f1e9b6050bf1ea62f23bc6410f","observation_id":"52398a3e-4123-4ff3-866e-7a4699707149","resolution":{"observed_at":"2026-08-06T00:30:10.821180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-06T00:30:10.872210Z","title":"Qwen3-omni technical report.arXiv preprint arXiv:2509.17765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.872210Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:184002dd30bdd419e43500d7b8114b98dafc987ed1395b1ea8d34d9605cf5e78","observation_id":"ab138103-f61e-474a-9fdd-fbe47ffc35e4","resolution":{"observed_at":"2026-08-06T00:30:10.872210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:14.565237Z","title":"Full-duplex-bench v1","venue":null,"work_id":"bdee70cc-6e9c-4eec-bff0-db18198d7b68","year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.912943Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:0183ce3500900ce33265b8dd0afdb011c355af86a6691bb826437e1c530d2b21","observation_id":"d140047f-5374-4a98-8ebc-f37b8d0f1bd0","resolution":{"observed_at":"2026-08-06T00:30:14.664834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:14.387801Z","title":"Joyai-llm flash: Advancing mid-scale llms with token efficiency, 2026","venue":null,"work_id":"064b4954-e425-451f-b077-3a56345d95bb","year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.966840Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:e18a1dcda19a9f490aea9d85381b5fd15bedf9cd240c4603d43177f364ebc1dc","observation_id":"9d73f340-dfdf-4e12-92a4-117842d1e7be","resolution":{"observed_at":"2026-08-06T00:30:14.493409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:14.191164Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":"c35a2ed1-e803-4bf1-b85b-dd79d942d701","year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.076411Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:c32388577df140f45d1676d7f9ac0a17f6d86f84f8549d98d01aff15e00857ed","observation_id":"541ade7c-7b87-4e23-9450-07008f4c1238","resolution":{"observed_at":"2026-08-06T00:30:14.284823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:13.937470Z","title":"Charles, Cheng Chen, Guanduo Chen, Haiting Chen, Huarong Chen, Jiahao Chen, et al","venue":null,"work_id":"9d547ee1-68ce-4467-b35f-1ad0cb89de83","year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.169630Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:1b43634a6758439c8d0a64535a6e4c9fc0a30fbb3bbf0d7d6fb8ecf1d73d4898","observation_id":"a908f1e1-28da-474a-9c9a-1f39c1edf920","resolution":{"observed_at":"2026-08-06T00:30:14.061828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:11.238953Z","title":"Joyvoice: Long-context conditioning for anthropomorphic multi-speaker conversational synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.238953Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:e3c6bc434029e2423b870e7a69837150cc153c4fc93c3c2fa7a0abb55df9ef22","observation_id":"61cfc91b-56a6-4d4c-9563-6084e2b3e3df","resolution":{"observed_at":"2026-08-06T00:30:11.238953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:13.689725Z","title":"Interaction models: A scalable approach to human-ai collaboration.Thinking Machines Lab: Connectionism, May 2026","venue":null,"work_id":"bc96683c-9f8e-4bc6-83f6-412f4a321bf6","year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.311537Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:25a0e7f1051a336f27fe99bdd0eff3be21c8009a413ad5b9e0cfd4dcdfadce83","observation_id":"628f88d7-b279-4863-a476-f19a392e2d9c","resolution":{"observed_at":"2026-08-06T00:30:13.800415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:13.491661Z","title":null,"venue":null,"work_id":"c6f55d83-7dda-4f4c-8ebc-ac713753365c","year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.406010Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:da3ca517fb63077d09dd744c281a703ddbd1232135920810d537c1760f3ead6f","observation_id":"8c02733f-b0e2-4e28-a769-5559d90237ed","resolution":{"observed_at":"2026-08-06T00:30:13.581387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:13.293691Z","title":null,"venue":null,"work_id":"d2ecb4d5-56f6-4b07-a748-cee10d310518","year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.486175Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:963703cc1b80e7ca12699a39766be9b3dedcb1a4c807741cb8c8bbb013638a9d","observation_id":"35e76cc7-99cc-4623-a452-fe026c25a7ed","resolution":{"observed_at":"2026-08-06T00:30:13.373000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:13.085359Z","title":"Uro-bench: Towards comprehensive evaluation for end-to-end spoken dialogue models","venue":null,"work_id":"33a0972b-f2c4-4587-b52a-f96ad1680222","year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.575149Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:9c6619e44cf58a4f24ed312775abe4a8e32c70389ba5ef9b92d252e5e325bd49","observation_id":"dfae0f97-7e32-42ba-98c4-38bc3434682b","resolution":{"observed_at":"2026-08-06T00:30:13.183293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:12.868001Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":"853d8ee8-039a-41d6-a2cc-77615784cec8","year":2024},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.677624Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:ca4895f853c020b8327c22baa323bcf22e3b55cf93264f1440dab541fa779340","observation_id":"84a57bcc-1d3b-4aff-a185-7803ea456070","resolution":{"observed_at":"2026-08-06T00:30:12.972047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:12.695259Z","title":"Schuller, and Jianhua Tao","venue":null,"work_id":"9cdaa739-da83-43f7-8f5f-67835756a3be","year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.766423Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:995b851e05933ed5feff2c24d022aaa36de8d976e8aca8fdd388459e81019831","observation_id":"fe411018-4dad-4230-b1e6-f711817657f7","resolution":{"observed_at":"2026-08-06T00:30:12.766278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:11.852258Z","title":"Echomind: An interrelated multi-level benchmark for evaluating empathetic speech language models.CoRR, abs/2510.22758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.852258Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:85276af19a0866e36141a91ca380e3590a328ff09a407d8830f5f299b5e08b6d","observation_id":"2ba383fd-2bbc-47a4-a865-eabd4edfa3e4","resolution":{"observed_at":"2026-08-06T00:30:11.852258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:11.954747Z","title":"Easy turn: Integrating acoustic and linguistic modalities for robust turn-taking in full-duplex spoken dialogue systems.CoRR, abs/2509.23938, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:11.954747Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:e76f3c86d9e7f3d7602063e908e4722d2a0948c2e59757efd4c5eb133e3ca4be","observation_id":"4f8514ff-761c-414d-bbf3-1b6782f4248e","resolution":{"observed_at":"2026-08-06T00:30:11.954747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:30:12.006697Z","title":"Soulx-duplug: Plug-and-play streaming state prediction module for realtime full-duplex speech conversation.arXiv preprint arXiv:2603.14877, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:12.006697Z"},"links":{"citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:9ef4f71c131d161443de6ed7f96668f2194bd98a89a982b044ebad4346254d8c","observation_id":"229d3229-7ef9-48c5-8938-fa6f53bfc3e2","resolution":{"observed_at":"2026-08-06T00:30:12.006697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01897","snapshot_observed_at":"2026-08-06T00:30:12.085175Z","title":"Fastturn: Unifying acoustic and streaming semantic cues for low-latency and robust turn detection.CoRR, abs/2604.01897, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:12.085175Z"},"links":{"cited_paper":"/paper/2604.01897","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:fd1322adb10c36d823f6ef3ba40e034fcbd86c0e8a6f5477782b4c4466ad6233","observation_id":"af842580-0665-431a-9382-1f366bd5c6ce","resolution":{"observed_at":"2026-08-06T00:30:12.085175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05481","last_updated":"2021-12-29T10:38:00Z","snapshot_observed_at":"2026-07-06T10:22:25.341862Z","submitted_at":"2020-12-10T06:54:54Z","title":"Unified Streaming and Non-streaming Two-pass End-to-end Model for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05481","snapshot_observed_at":"2026-08-06T00:30:12.153813Z","title":"Unified streaming and non-streaming two-pass end-to-end model for speech recognition.arXiv preprint arXiv:2012.05481, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:12.153813Z"},"links":{"cited_paper":"/paper/2012.05481","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:304d3324fd1e2da0732cd3b3564236074521f2bf7b59617fda814247b9417a2c","observation_id":"77d40865-6b3f-4ab8-9f6e-45ff83bf3fcc","resolution":{"observed_at":"2026-08-06T00:30:12.153813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2608.01119."}