{"as_of":"2026-08-21T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:847631c6adcff3e4dd0d3f21701492beedba17fe7e8cbd8bb9df3063b327207c","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:36:06.487611Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T23:23:47.291534Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:39:01.897662Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"cited_work":{"arxiv_id":"2509.03940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03940","snapshot_observed_at":"2026-07-03T22:39:01.897662Z","title":"V oxRole: A comprehensive benchmark for evaluating speech-based role- playing agents,","venue":null,"work_id":"51035716-dbb6-4d9d-bde1-9f50951979d8","year":2025},"citing_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-08-15T08:40:26.674407Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:25.660785Z"},"links":{"cited_paper":"/paper/2509.03940","citing_paper":"/paper/2604.13804"},"observation_digest":"sha256:eb1ffb012a4acd8024a19769cbced91d28260beebe0db34a6da0e0d9de4c1281","observation_id":"211cbeb2-0bfd-4997-86a0-86c4add2122c","resolution":{"observed_at":"2026-05-10T14:25:30.165181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"cited_work":{"arxiv_id":"2509.03940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03940","snapshot_observed_at":"2026-07-03T22:39:01.897662Z","title":"V oxRole: A comprehensive benchmark for evaluating speech-based role- playing agents,","venue":null,"work_id":"51035716-dbb6-4d9d-bde1-9f50951979d8","year":2025},"citing_paper":{"arxiv_id":"2606.17669","last_updated":"2026-06-16T08:30:47Z","snapshot_observed_at":"2026-08-14T16:06:08.755729Z","submitted_at":"2026-06-16T08:30:47Z","title":"DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T23:23:47.291534Z"},"links":{"cited_paper":"/paper/2509.03940","citing_paper":"/paper/2606.17669"},"observation_digest":"sha256:f396b0e5de33d1eb0a09a4dc871258988cdd6b2403310adf532b37796960cca1","observation_id":"f3ba0f25-1e94-4539-9d43-587ae4f8c0d5","resolution":{"observed_at":"2026-07-03T22:39:01.899081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.03940/citation-record","integrity":"/paper/2509.03940/integrity","json":"/paper/2509.03940/citation-record.json","paper":"/paper/2509.03940"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-05T10:36:06.397319Z","title":"arXiv preprint arXiv:2410.17196","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.397319Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:2739aeeb6d3b9a1d8f580bf637fe9b1a0f9c118c357ef5f09ede8deaef16fb95","observation_id":"d182ce33-700e-4508-81bd-68d54a27bbd5","resolution":{"observed_at":"2026-08-05T10:36:06.397319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04203","last_updated":"2025-02-17T08:40:51Z","snapshot_observed_at":"2026-08-19T18:12:59.592983Z","submitted_at":"2024-08-08T03:57:20Z","title":"MMRole: A Comprehensive Framework for Developing and Evaluating Multimodal Role-Playing Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04203","snapshot_observed_at":"2026-08-05T10:36:06.402445Z","title":"arXiv preprint arXiv:2408.04203","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.402445Z"},"links":{"cited_paper":"/paper/2408.04203","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:1679ae65878c737df11290ec41425717bf46b4177b61fcca53f79b9af3ee1fb2","observation_id":"879e9837-eb19-4e3d-9436-7e39a6276806","resolution":{"observed_at":"2026-08-05T10:36:06.402445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T10:36:06.407429Z","title":"arXiv preprint arXiv:2410.00037","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.407429Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:4f2fea47fb1dc11e9f1b9e5f4ee05bc86fc3c45dda811f5ecf46b6298aae558d","observation_id":"5967656f-7727-47a0-9e23-059b5d5d582c","resolution":{"observed_at":"2026-08-05T10:36:06.407429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T10:36:06.417604Z","title":"arXiv preprint arXiv:2410.21276","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.417604Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:39f70d295f977d03d07cc1fff2c715ab75843561c11b3fc52e83d40b7c839a4f","observation_id":"4b0f3d85-50f1-451f-84ef-70923caf34f5","resolution":{"observed_at":"2026-08-05T10:36:06.417604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02083","last_updated":"2024-11-04T19:51:53Z","snapshot_observed_at":"2026-08-20T12:05:09.303484Z","submitted_at":"2023-02-04T03:50:01Z","title":"Evaluating Large Language Models in Theory of Mind Tasks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02083","snapshot_observed_at":"2026-08-05T10:36:06.423054Z","title":"arXiv preprint arXiv:2302.02083, 4:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.423054Z"},"links":{"cited_paper":"/paper/2302.02083","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:30050793b998f7578ebcbceb46231dcfdb899a333617de51f0fe0520297dd718","observation_id":"2ac3479e-559f-4eb7-959a-cad129263656","resolution":{"observed_at":"2026-08-05T10:36:06.423054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-16T12:55:42.223198Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T10:36:06.427752Z","title":"arXiv preprint arXiv:2502.17239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.427752Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:ef350eb68784e470ebfa840ca3c0d223e19f9fdf73ca57c6a028c7db19ed7454","observation_id":"6eb69524-e602-42c6-9335-744ef968d22f","resolution":{"observed_at":"2026-08-05T10:36:06.427752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-21T05:28:09.864471Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T10:36:06.433253Z","title":"arXiv preprint arXiv:2503.04721","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.433253Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:9e04e92aa6fe7bfd37ece56d7f94d439386ec168ce6af891e96f94f547695933","observation_id":"6ae4e850-b523-4a30-8178-090802812d79","resolution":{"observed_at":"2026-08-05T10:36:06.433253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11387","last_updated":"2025-02-17T03:08:37Z","snapshot_observed_at":"2026-08-19T04:51:40.320390Z","submitted_at":"2025-02-17T03:08:37Z","title":"RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11387","snapshot_observed_at":"2026-08-05T10:36:06.438941Z","title":"Ma, Z.; Zheng, Z.; Ye, J.; Li, J.; Gao, Z.; Zhang, S.; and Chen, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.438941Z"},"links":{"cited_paper":"/paper/2502.11387","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:69e26444dce20b4a10462559e49eab6b51655def80d1816fe1240f113022a091","observation_id":"5d3bde82-2bb4-4935-b1ff-416b2c91e569","resolution":{"observed_at":"2026-08-05T10:36:06.438941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-18T15:57:37.984685Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T10:36:06.444581Z","title":"arXiv preprint arXiv:2312.15185","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.444581Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:b958a167b1735cdb1347956bbe1510152635fdc0715431e9aeee3f4d27300371","observation_id":"4f720ed5-cb13-4286-845c-a4e5e3b0d86e","resolution":{"observed_at":"2026-08-05T10:36:06.444581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01275","last_updated":"2024-01-09T18:54:05Z","snapshot_observed_at":"2026-08-17T17:53:21.053135Z","submitted_at":"2024-01-02T16:20:40Z","title":"CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01275","snapshot_observed_at":"2026-08-05T10:36:06.450675Z","title":"arXiv preprint arXiv:2401.01275","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.450675Z"},"links":{"cited_paper":"/paper/2401.01275","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:cd3749a466fdb0fb04987ff7e4da267cd5c21b18fbb68f28fb2c1dc60c8cc22c","observation_id":"d0ab30de-2910-480f-a0ed-12d34126c37e","resolution":{"observed_at":"2026-08-05T10:36:06.450675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:06.457095Z","title":"arXiv preprint arXiv:2502.09082","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.457095Z"},"links":{"citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:53ab55dd96f26a536e4da8cf344c8d19a7113de09c26647aa0c59cbf6b99aa6d","observation_id":"49028659-6b2a-41c8-8c9e-c9be2fd46ec0","resolution":{"observed_at":"2026-08-05T10:36:06.457095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-19T12:40:58.780256Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-05T10:36:06.461904Z","title":"arXiv preprint arXiv:2310.00746","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.461904Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:f0aa98e049c46afc9b1fe1956b1b916cd049f43818f8bfa42166e730b39fd61d","observation_id":"db3614dc-7a7f-4451-be46-e0fce240432e","resolution":{"observed_at":"2026-08-05T10:36:06.461904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T10:36:06.466980Z","title":"5-omni technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.466980Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:7d3574789040fda1b9143919153979a38c8a0ecc50086e0006870c082a87eff5","observation_id":"83a874ab-64a4-4e31-bbaa-4c5a3015a8e2","resolution":{"observed_at":"2026-08-05T10:36:06.466980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17810","last_updated":"2025-08-10T12:34:42Z","snapshot_observed_at":"2026-08-17T07:39:45.117423Z","submitted_at":"2025-02-25T03:31:48Z","title":"URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17810","snapshot_observed_at":"2026-08-05T10:36:06.472390Z","title":"Zeng, A.; Du, Z.; Liu, M.; Wang, K.; Jiang, S.; Zhao, L.; Dong, Y .; and Tang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.472390Z"},"links":{"cited_paper":"/paper/2502.17810","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:fd1a5aad0d31e6f91dfd0ffa2f5744eba7b8f8831376157c93e6036b61b8f26c","observation_id":"d17a3726-3a7b-4486-a695-6b0d4d77566b","resolution":{"observed_at":"2026-08-05T10:36:06.472390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-05T10:36:06.477526Z","title":"arXiv preprint arXiv:2412.02612","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.477526Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:806b6d1b803591681ae02e171cdab5283c4e1d9516a1f1463fbc2b0655ca52e8","observation_id":"8c5927f2-6892-4b69-8a73-7dd5735b9669","resolution":{"observed_at":"2026-08-05T10:36:06.477526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-13T04:50:32.015134Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20277","snapshot_observed_at":"2026-08-05T10:36:06.482387Z","title":"arXiv preprint arXiv:2505.20277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.482387Z"},"links":{"cited_paper":"/paper/2505.20277","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:648860761e0ad2cbae677fd45617226bf3cceecc83d9ecb476f6637db294497e","observation_id":"a4a6a580-96cf-40c4-b852-4d92d09dcbcc","resolution":{"observed_at":"2026-08-05T10:36:06.482387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-05T10:36:06.487611Z","title":"arXiv preprint arXiv:1904.09675","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.487611Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:cacb537f77b1c993c1ec3cde400d3c719d9501c3855fbb53254dcfc02542da5e","observation_id":"dfb5b3fe-a44e-4673-a7ba-aa74c33934b5","resolution":{"observed_at":"2026-08-05T10:36:06.487611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T10:36:06.387483Z","title":"arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.387483Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:3f66e69429487e89f813d45b1b836b3019eef96c2e11c9d592be9434a40ee559","observation_id":"00b818e6-1cb8-42b1-ad9b-23c49ca56607","resolution":{"observed_at":"2026-08-05T10:36:06.387483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:06.923062Z","title":"In 2024 IEEE Spo- ken Language Technology Workshop (SLT), 818–824","venue":null,"work_id":"c6bb91a0-dbb1-41bd-bb42-fa97735cdf90","year":2024},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.392409Z"},"links":{"citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:6b6df56f2acdb114a55338350025187553925956a83f7a4cc01263645dca4c62","observation_id":"449e0b3b-926a-412a-aac5-ca68e7b7b30c","resolution":{"observed_at":"2026-08-05T10:36:06.930583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-05T10:36:06.412825Z","title":"arXiv preprint arXiv:2502.11946","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.412825Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:df5eb47a2e4d89d5084e0e5063b49b0138b9b23869328df3cc5637bf6a147623","observation_id":"10e02dce-04fd-4a16-b62d-ee6201480ee7","resolution":{"observed_at":"2026-08-05T10:36:06.412825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T17:44:47.095457Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2509.03940."}