{"as_of":"2026-08-18T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65aeccdd922e2349d92d04e2d0a98b1f0dd6b4705cb59bf376db1d9578dc04b7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:32:49.025992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-08-12T22:36:47.817564Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T13:32:57.771753Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2505.15957"},"observation_digest":"sha256:54852ba0434d475b9dcc7fd086ba006cc48bb043b4035cb93fe50a3852d779dc","observation_id":"c990e527-a1ec-4f8b-bfa5-177fdfc5632a","resolution":{"observed_at":"2026-05-22T13:34:53.252276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-07T10:17:46.964197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-17T19:45:22.860227Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":211,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.964197Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:61ce22286826cd96e55289a7e412732a0d4eb7b77c0d2db24d88a2db6d1f3c56","observation_id":"2beac486-2194-4931-801e-d0db7e483580","resolution":{"observed_at":"2026-08-07T10:17:46.964197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T10:36:06.433253Z","title":"arXiv preprint arXiv:2503.04721","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.433253Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:85f87dc5db524658cece9b7c6ce3d441c073a29baae34cc3bb5a633e8fa25e3e","observation_id":"6ae4e850-b523-4a30-8178-090802812d79","resolution":{"observed_at":"2026-08-05T10:36:06.433253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:4383e3e1618b1239b9d9c48da8941cc0dd5e90c7f74d2b03ad5b67a59f94ef76","observation_id":"ae7a5176-6145-4323-9212-42779a9eeeb4","resolution":{"observed_at":"2026-05-18T11:52:35.699998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-04T11:06:46.172940Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-16T08:16:49.998738Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.172940Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:6642eae9abb608b73621b957322483b6442217259e33696ed2593f50063cc3ce","observation_id":"8cf06290-04af-4d4b-b500-0508e399abb4","resolution":{"observed_at":"2026-08-04T11:06:46.172940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-03T00:56:57.985671Z","title":"S., Wang, Q., Lian, J., Li, T., Watanabe, S., and yi Lee, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11065","last_updated":"2026-05-28T11:37:06Z","snapshot_observed_at":"2026-08-12T06:47:36.412262Z","submitted_at":"2026-02-11T17:32:52Z","title":"S-MARC: Causal Streaming Reasoning for Full-Duplex Conversational Behavior Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T00:56:57.985671Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2602.11065"},"observation_digest":"sha256:c2e6379ceb6d3e37234f5e03b498b5ab0b78e72b188275fde8b5b199ed99ca4d","observation_id":"02ecf6c8-f8e1-4925-a5e4-758781b5a2ec","resolution":{"observed_at":"2026-08-03T00:56:57.985671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2603.09643","last_updated":"2026-04-16T11:12:58Z","snapshot_observed_at":"2026-08-16T01:09:38.256919Z","submitted_at":"2026-03-10T13:18:02Z","title":"MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T13:43:52.671745Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.09643"},"observation_digest":"sha256:c243713d65c389395dd21e02c3721a6ba09c4ec4eb8ad7546efd0df8057292d7","observation_id":"f89d0edd-88b5-423c-a8a5-0b2744e6b8fd","resolution":{"observed_at":"2026-05-15T13:45:52.191015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-07-13T23:27:58.971096Z","title":"Liu, and Hung-yi Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16859","last_updated":"2026-07-01T09:16:52Z","snapshot_observed_at":"2026-08-12T16:11:36.690343Z","submitted_at":"2026-03-17T17:58:44Z","title":"SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:58.971096Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.16859"},"observation_digest":"sha256:18d63397b522d3ac787f464e6ee8a6f037e368a8e75bb56314e74f23954f2db6","observation_id":"4d1a2681-0ef6-4f88-9f53-f1ecc6d8006a","resolution":{"observed_at":"2026-07-13T23:27:58.971096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T08:34:56.898815Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:1fa506660c5951b6330517c6a11b251e5fdbad1758cca6399601866f714eef38","observation_id":"84b59eb0-9027-4405-8b14-a3a8b050e2c8","resolution":{"observed_at":"2026-05-15T08:35:18.332156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T10:43:27.176535Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:3e7edd0af440512e0fd7039efc4529584b776b7c8891dd5c6df293bc186b8b22","observation_id":"18452c28-839f-4e4a-9ca9-6f0052de6f34","resolution":{"observed_at":"2026-05-21T10:44:07.708466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-07-13T22:57:11.059962Z","title":"H., and Lee, H.-y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T22:57:11.059962Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:e466263a78236cdf246f843b08a6f12e2a981ffddae27b6efb9379ec233ebf24","observation_id":"78557d2d-64ad-4879-96b8-4f415f42d721","resolution":{"observed_at":"2026-07-13T22:57:11.059962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-17T23:10:58.941065Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:0b6eb59aec6c859ee593ba375f74e7f94cd158c0075b019368608a1f930d5751","observation_id":"d284d9fc-9333-407c-8c48-5b07ce5ebc4a","resolution":{"observed_at":"2026-05-15T00:39:35.848037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Full-duplex-bench: A benchmark to evaluate full- duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-17T06:14:14.627094Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:c3e1be852971576785f3f1cb51917fc115e1ed641a0812ff9410abc2f04fd1ea","observation_id":"e7a7203a-509e-4929-92eb-fe3566c3525a","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:26a341f3cebc57e9305566062f451b66fbe255283eda71f2f059c4b0f32afd63","observation_id":"64793511-de1c-4a0d-8a5e-c9775f3fc9a6","resolution":{"observed_at":"2026-05-13T20:58:15.966852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-08-13T18:44:53.184030Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:45.214298Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2604.10065"},"observation_digest":"sha256:694a94e5b22343145559f12bbfb20738f566a2e8b809a442102c29098bf80c72","observation_id":"7136dbb4-8133-401b-8763-cc7524c90adb","resolution":{"observed_at":"2026-05-11T07:35:58.704003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2604.21406","last_updated":"2026-04-24T04:15:19Z","snapshot_observed_at":"2026-08-16T13:54:57.694543Z","submitted_at":"2026-04-23T08:21:52Z","title":"Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T13:19:44.156822Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2604.21406"},"observation_digest":"sha256:1e26a313ad464f246f9dc0a6e881f5d49d9a51d141f8142d3916c2c228580390","observation_id":"a564a572-ba84-4537-a1e1-b19a3e535b6d","resolution":{"observed_at":"2026-05-11T18:56:06.718800Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.11484","last_updated":"2026-06-08T03:31:54Z","snapshot_observed_at":"2026-08-16T16:36:41.501680Z","submitted_at":"2026-05-12T04:02:03Z","title":"Engagement Process: Rethinking the Temporal Interface of Action and Observation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:37:31.252556Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.11484"},"observation_digest":"sha256:f4fd6b2d4e51af9585b9e676b5a273254d73b953dbf594b7ca8bf25b0b74b43b","observation_id":"777175d0-7ec6-4d73-b40f-8715caee59d2","resolution":{"observed_at":"2026-05-13T01:42:04.088344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.11484","last_updated":"2026-06-08T03:31:54Z","snapshot_observed_at":"2026-08-16T16:36:41.501680Z","submitted_at":"2026-05-12T04:02:03Z","title":"Engagement Process: Rethinking the Temporal Interface of Action and Observation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T22:40:05.658212Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.11484"},"observation_digest":"sha256:c291ee138c95ee5f0684ff10a389642ce281edb0cf45dea025de10988d3ed4c6","observation_id":"ceddedf4-47e1-4264-b090-c9b58327f235","resolution":{"observed_at":"2026-07-01T13:45:46.531430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.13841","last_updated":"2026-05-27T20:23:25Z","snapshot_observed_at":"2026-08-13T14:11:16.548842Z","submitted_at":"2026-05-13T17:58:52Z","title":"EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T17:30:51.434783Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.13841"},"observation_digest":"sha256:f5c6bd36d81361a4918ac71f5af54140d59da09d98466329e004d3090e08f0b6","observation_id":"2ba30418-8c22-4a4e-ab69-e5498a9f4cf8","resolution":{"observed_at":"2026-05-14T17:32:30.671308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.13841","last_updated":"2026-05-27T20:23:25Z","snapshot_observed_at":"2026-08-13T14:11:16.548842Z","submitted_at":"2026-05-13T17:58:52Z","title":"EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T21:18:50.219775Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.13841"},"observation_digest":"sha256:6282d6c55144517fc10e7766ff3ae401af98513f30c461186c31e71cb98fa485","observation_id":"d7fcef41-b114-4c76-9f6b-2a7add5d7f53","resolution":{"observed_at":"2026-07-01T14:25:47.121399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-08-17T04:09:44.469533Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T13:36:44.071188Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:06f9f0f45c32b4701d90d39b5f38ae75a0ca0b163769487f502cb6e64f4402d5","observation_id":"0571a4ea-d4cc-4d8f-83d6-aaa41abe1d58","resolution":{"observed_at":"2026-05-20T13:38:19.132231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-08-17T04:09:44.469533Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-04T01:11:42.073993Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:7393e61556ae639938e1a4707ba5bbf2257b82f1e65ba42141205a7a051327e2","observation_id":"f9325fc2-671f-4baf-9400-52b50a1a7f57","resolution":{"observed_at":"2026-07-04T01:19:20.266187Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-16T00:00:14.809961Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:48bdc8a2c1c4b9f6a1b0efd1b9b8f61b8add0dd1a9345918e9e093c6e6b089d5","observation_id":"b9fd82de-09c3-44a5-b2e9-acfc33543015","resolution":{"observed_at":"2026-05-21T07:39:48.826169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20356","last_updated":"2026-05-19T18:11:03Z","snapshot_observed_at":"2026-08-16T10:39:29.302164Z","submitted_at":"2026-05-19T18:11:03Z","title":"Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T07:44:41.218602Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20356"},"observation_digest":"sha256:1a1a13a73c4b83b6edc5f69fd079480d999586ce52b5e85b90a30040a11da61b","observation_id":"58b016e8-e817-4b13-baf2-6364735ad6f2","resolution":{"observed_at":"2026-05-21T07:44:48.635509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:38936cd76f756e0bea23136f4e8d563b410ff95a093bdcbeb0a5e50e26944962","observation_id":"d4adfbf8-d97b-4954-bbe0-ddfe943f03f3","resolution":{"observed_at":"2026-05-21T02:43:55.073184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:89412e7fef6b6dcffd1a7754b05ed6271cdc8c3066e2caa45d3df5f1bd995c65","observation_id":"34394e45-5b0c-431d-baca-212bcd26ae95","resolution":{"observed_at":"2026-06-30T17:34:57.367281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":281,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:59120392d10f61737514474959090c9b568fff6f9a9bf62911b8e38ab2fb864f","observation_id":"a59d39be-10e7-40e4-8607-b9d0fa3a9477","resolution":{"observed_at":"2026-06-29T23:04:01.943523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.30256","last_updated":"2026-07-28T20:35:17Z","snapshot_observed_at":"2026-08-02T12:51:48.638833Z","submitted_at":"2026-05-28T17:20:01Z","title":"VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T08:28:50.818250Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.30256"},"observation_digest":"sha256:c6c8156097017ab5a6ad53467729c014a3bd1cab4daefeed730f9640bdbefe0a","observation_id":"664871ce-2e33-4d30-a607-c518bb221e4b","resolution":{"observed_at":"2026-06-29T08:33:15.305457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-02T12:51:51.235705Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities.arXiv preprint arXiv:2503.04721, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30256","last_updated":"2026-07-28T20:35:17Z","snapshot_observed_at":"2026-08-02T12:51:48.638833Z","submitted_at":"2026-05-28T17:20:01Z","title":"VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:51:51.235705Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.30256"},"observation_digest":"sha256:f28e20cc3f3a380cfad0f1725a3df378f40e870b56e2e8d6c2f773fecd33ab06","observation_id":"5411a39f-93f5-46f6-b218-34a104756923","resolution":{"observed_at":"2026-08-02T12:51:51.235705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:61c12196593574518ea2eee6d8cc25c8ea938e63abeeaef5017fed9b43724215","observation_id":"c638c299-5ffc-48b8-8338-4b8eb26dafe0","resolution":{"observed_at":"2026-07-02T01:06:23.921592Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:efc7adad943d3af6acb899c457f7b232075e9b06c4ea752510726d3073eb5c8f","observation_id":"b5ff4194-1ca8-44b0-96fd-9c68d743e00a","resolution":{"observed_at":"2026-06-27T13:20:57.365401Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.11386","last_updated":"2026-06-09T19:08:07Z","snapshot_observed_at":"2026-08-15T06:53:04.268425Z","submitted_at":"2026-06-09T19:08:07Z","title":"Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:22:52.428152Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.11386"},"observation_digest":"sha256:7e68f17ea97543413075d3969cdd1525d8838a662297087ea813840ad224df8d","observation_id":"61276ce8-f43d-41b8-9bb6-4b520184071e","resolution":{"observed_at":"2026-07-03T05:07:39.487661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.13450","last_updated":"2026-06-11T15:09:45Z","snapshot_observed_at":"2026-08-15T00:22:19.965892Z","submitted_at":"2026-06-11T15:09:45Z","title":"Endpoint Anticipation for Low-Latency Spoken Dialogue","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T05:37:17.684884Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.13450"},"observation_digest":"sha256:af069347b4997d283df3196281191d792845ed67f0da15baed49a429c8c62eb4","observation_id":"5c13e92f-89b3-4bd4-9d7a-16bd3f4dab9d","resolution":{"observed_at":"2026-07-03T16:28:39.138388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.17542","last_updated":"2026-06-16T05:46:44Z","snapshot_observed_at":"2026-08-07T21:15:53.345794Z","submitted_at":"2026-06-16T05:46:44Z","title":"Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T01:14:24.096827Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.17542"},"observation_digest":"sha256:c7e695b41dde67199c46fb41ce6aff6c9bef13d10c7a2278ea603a09272009ac","observation_id":"b8516e12-846a-4276-ae49-8288f3a2b13b","resolution":{"observed_at":"2026-07-03T20:38:55.734168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-08-12T18:49:26.971639Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:e7aa301f1d67ecc92dcb38dfce4508e85baea23812799e015197176468d86d4f","observation_id":"94e724fe-7e45-4836-9408-5f39b7802450","resolution":{"observed_at":"2026-07-04T02:49:25.047644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.30145","last_updated":"2026-06-29T11:22:50Z","snapshot_observed_at":"2026-08-08T07:29:41.174359Z","submitted_at":"2026-06-29T11:22:50Z","title":"FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T06:38:28.718164Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.30145"},"observation_digest":"sha256:ead097d6f8de54229551ad085bc256267fc81a88d7e40090ed81d0f13cf15c1a","observation_id":"412a0332-87c7-440b-ae1b-02c31de5591b","resolution":{"observed_at":"2026-06-30T06:44:19.409994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-08-14T10:16:36.384280Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T21:22:38.888528Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:a531bad8890b387d17a58a60377946c239ac1ee5872993e2a747862449a115f4","observation_id":"968c6909-3f88-4d99-951a-81f2048b35de","resolution":{"observed_at":"2026-07-03T21:28:58.303637Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-07-12T08:53:13.408944Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-08-14T10:16:36.384280Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T08:53:13.408944Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:4fbfcc76859852f609a09f78e8429376d0e60f88ac932a8a6c90c5f4ddfdca7e","observation_id":"977ce5cb-4b35-4328-bf34-c75362b4436c","resolution":{"observed_at":"2026-07-12T08:53:13.408944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-14T20:31:36.453957Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:4906710c9786cd7658df7ff4b1dd380828fbe7eea851f5c715759f29be014ef9","observation_id":"4c58e7d2-efcf-4901-a686-426ef16586fb","resolution":{"observed_at":"2026-07-08T02:44:27.586165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2607.07985","last_updated":"2026-07-08T23:24:55Z","snapshot_observed_at":"2026-08-07T05:14:48.269155Z","submitted_at":"2026-07-08T23:24:55Z","title":"A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:13:50.737253Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.07985"},"observation_digest":"sha256:11b88a110179f1af19304fd9ec4da0a6568c7f00ac8722453b60735df0cb19b3","observation_id":"25971a8a-8c26-46ea-87ba-1e2cf16b58d8","resolution":{"observed_at":"2026-07-10T14:17:10.076707Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-01T01:56:12.513345Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:12.513345Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:0a575156978590088e2f682aeae544bb0ddc7e853f9af403747bd3818d7129d1","observation_id":"a86a3fd3-8800-476b-a9e9-0bd5e4630dfc","resolution":{"observed_at":"2026-08-01T01:56:12.513345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-11T00:32:49.025992Z","title":"Liu, and Hung-yi Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07631","last_updated":"2026-08-07T12:55:43Z","snapshot_observed_at":"2026-08-17T12:20:37.702430Z","submitted_at":"2026-08-07T12:55:43Z","title":"PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:32:49.025992Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2608.07631"},"observation_digest":"sha256:ff63a61901604124358c49ced451a8bc919b0c1048cf98cf4f224729f8a61f34","observation_id":"5fc3334f-f379-4d85-a5c1-1bc69897d017","resolution":{"observed_at":"2026-08-11T00:32:49.025992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.04721/citation-record","integrity":"/paper/2503.04721/integrity","json":"/paper/2503.04721/citation-record.json","paper":"/paper/2503.04721"},"outbound":[],"paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2503.04721."}