{"as_of":"2026-08-13T11:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20ae140f01fb59e49fce45946c7029eabe28ba231b32c89003bcee732a350d9f","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:52:46.705383Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09189/citation-record","integrity":"/paper/2608.09189/integrity","json":"/paper/2608.09189/citation-record.json","paper":"/paper/2608.09189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.382221Z","title":null,"venue":null,"work_id":"757ca03d-1454-4527-93bb-a36922b691da","year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.576288Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:eb50e959a6f64aeb56711def4e361d370dad3df2b78fdc29b8693557e6a135b9","observation_id":"84d87df0-2e29-47dc-a317-3861df254e5b","resolution":{"observed_at":"2026-08-11T21:52:47.385208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-11T21:52:46.580175Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.580175Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:3ac119b4f250b31a888bc87155bbfa0cf9915631fb4e5fbfbc68e32d1c6bbc9b","observation_id":"01c88ccb-bae5-4fd6-a1ba-d97519925d68","resolution":{"observed_at":"2026-08-11T21:52:46.580175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.373926Z","title":null,"venue":null,"work_id":"c1680e39-7bcb-4936-9326-f4da8b9f1391","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.583766Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:4e118b01e1fff427aad45fa4c76dd709c35f336bbb6009767e93fe1a6b23450f","observation_id":"4787ffdc-743e-41b7-b663-15e84fb30492","resolution":{"observed_at":"2026-08-11T21:52:47.376822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-11T21:52:46.587088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.587088Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:654ca209b89847ecdae27ba3bab62f81281db9f1e1314216fd2bed3facd8f076","observation_id":"482d775e-b19e-49d2-9ae4-b25097575b49","resolution":{"observed_at":"2026-08-11T21:52:46.587088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.365596Z","title":null,"venue":null,"work_id":"dee41dd1-0c34-4f30-99f0-5ef9fee428fa","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.590422Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:d687e74d70de273750e09919807fd456fe452e2a9677bd59eec4465274536d79","observation_id":"bca3a85a-75ea-4163-bf15-eb35c1eacde8","resolution":{"observed_at":"2026-08-11T21:52:47.368432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.357371Z","title":null,"venue":null,"work_id":"2d4fde80-c7cc-4bed-b656-75d2ebc297b1","year":2010},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.593438Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:90a84dd16c3cee8fd40ac5953e9af1b2bd6e1e8fe1678461b26933866464604d","observation_id":"9500a49c-3edf-4331-9c8d-19981183eb4c","resolution":{"observed_at":"2026-08-11T21:52:47.360278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-13T05:33:22.244747Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-11T21:52:46.596752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.596752Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:258c7af82d513571ab287fdfb21c4c8d319e9dbc31007550b241e49fe5a3952c","observation_id":"2df0a905-e9b1-4fe0-bc29-39eaf31dea48","resolution":{"observed_at":"2026-08-11T21:52:46.596752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-11T21:52:46.600178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.600178Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:d7b3624494a8de5c85c6843eeead52f958aeb8b4837f2b7d23180291a4ba0b55","observation_id":"3ece12c1-776f-40d9-a775-58f819841227","resolution":{"observed_at":"2026-08-11T21:52:46.600178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.348871Z","title":null,"venue":null,"work_id":"b79f75bf-5d0c-4029-96e5-47a72c110df0","year":2014},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.603512Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:b286eab6af5593ca52c0013a2872791ec9e63ac2a069be5074df45570c8183cb","observation_id":"9e2673d6-a486-495c-823d-e17601efc4ea","resolution":{"observed_at":"2026-08-11T21:52:47.351997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-11T15:34:43.632483Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04962","snapshot_observed_at":"2026-08-11T21:52:46.606480Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.606480Z"},"links":{"cited_paper":"/paper/2501.04962","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:3bb4d4db0fbca771380366f131738cb923afdf5e0d857262f164187baba07fc1","observation_id":"a0d3d4a0-7ec4-41f1-858a-e52641e48c35","resolution":{"observed_at":"2026-08-11T21:52:46.606480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-11T21:52:46.609635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.609635Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:ad28336fc27e1ceda9ecd93b50f22ddbfb1532fa770db0212041ce12b5b6d2cd","observation_id":"e7af6214-014b-49d2-b6d9-a94d5e326e64","resolution":{"observed_at":"2026-08-11T21:52:46.609635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-11T21:52:46.612899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.612899Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:a4b8879c7adc9c5c838b1175fd364f45bd18a459f252169eb5da8d75eddcdac2","observation_id":"16f8d10b-1914-4278-bd98-3880391344a9","resolution":{"observed_at":"2026-08-11T21:52:46.612899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.340478Z","title":null,"venue":null,"work_id":"c68d18f9-a471-479b-9cc4-bbee2119fb24","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.615866Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:ed457058e2d1f1c01b447a850dfbb300f500b673f3a235b9c629848962a94862","observation_id":"8c2adbe9-869a-48e7-9a50-94a15131c412","resolution":{"observed_at":"2026-08-11T21:52:47.343550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-08-07T15:56:21.924963Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02625","snapshot_observed_at":"2026-08-11T21:52:46.618653Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.618653Z"},"links":{"cited_paper":"/paper/2505.02625","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:95ec7c661bb4299fce2f8186ce26ced7b8c8fd26b7b040259124aa7277b43516","observation_id":"f51f6a65-299d-4836-a65e-8e60726b7666","resolution":{"observed_at":"2026-08-11T21:52:46.618653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.331174Z","title":null,"venue":null,"work_id":"d5321a44-cd25-43df-b638-7578952016bb","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.621739Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:5d60f5572076388146f60a7495921c31c63e6eca0e7183ead7e702f33b260b94","observation_id":"8c7cf331-fbfb-493c-988f-3572e5d7badd","resolution":{"observed_at":"2026-08-11T21:52:47.334058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09600","last_updated":"2025-09-03T13:33:34Z","snapshot_observed_at":"2026-08-10T11:32:29.120466Z","submitted_at":"2025-08-13T08:30:14Z","title":"OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09600","snapshot_observed_at":"2026-08-11T21:52:46.624507Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.624507Z"},"links":{"cited_paper":"/paper/2508.09600","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:4dd9140dcee9ef0021ccad31fd54be1b95f6fab2693866730fab91400ae4d91c","observation_id":"dde9fed8-c747-439f-86fd-742934e2b115","resolution":{"observed_at":"2026-08-11T21:52:46.624507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.322417Z","title":null,"venue":null,"work_id":"824849f3-8619-412a-9ce9-ebbd4c1e5cd1","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.627557Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:0dbcf4d59c6f5af8f9028226a200bdd639ad99ec382ead5afb894727a0e74b2c","observation_id":"6b98933a-fe2b-4378-abfc-e3f6255ef286","resolution":{"observed_at":"2026-08-11T21:52:47.325649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T21:52:46.630411Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.630411Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:947aa491a9c95034dbc80b48085ff10e8ecd59cd030fccd182c17f145574e1da","observation_id":"f6a68aee-852f-4c71-887b-d7767bc0c778","resolution":{"observed_at":"2026-08-11T21:52:46.630411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04424","last_updated":"2026-04-27T06:21:20Z","snapshot_observed_at":"2026-07-31T22:21:13.872121Z","submitted_at":"2025-02-06T18:13:35Z","title":"EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04424","snapshot_observed_at":"2026-08-11T21:52:46.633473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.633473Z"},"links":{"cited_paper":"/paper/2502.04424","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:917c8fc24fba6da3b46b1dcfda0273230a1a866ea7bc55278d7d7b3c175c5bf9","observation_id":"532f94a3-dab5-4bf9-938e-9026d9560729","resolution":{"observed_at":"2026-08-11T21:52:46.633473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.314387Z","title":null,"venue":null,"work_id":"ea642eb2-c65b-4e4b-bfdf-9a661046bd2d","year":null},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.636761Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:534e9c3f608b159b19f3d9a4fb7c0b8faa100589a74aa093888fbd120b5ff32c","observation_id":"fff411fa-53e8-4055-b2e4-c91586257a81","resolution":{"observed_at":"2026-08-11T21:52:47.316926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.641738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.641738Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:4040e6c11453ed01a1e68f67ce2edf2a5c6331ffbf2867bf0abddac000dd1e09","observation_id":"e716d0ba-da9b-4bd0-a96c-203c9938d4f7","resolution":{"observed_at":"2026-08-11T21:52:46.641738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.644112Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.644112Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:338052ff466f7c07398373a5cfe1452f635b0096fa9d18acfcff153a12654c2e","observation_id":"53b65b07-f069-4498-a6e2-5e2ab2c2cb75","resolution":{"observed_at":"2026-08-11T21:52:46.644112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.296922Z","title":null,"venue":null,"work_id":"b3c1b3cc-7650-47d0-ae0f-512bb81b3da1","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.646511Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:1e980fa4299f53713ffc998cd7e92e81c2d1d42ecc4f44b36c6ad75a413ff36e","observation_id":"b4d64760-8a12-4b93-a3db-59ab8fead4f5","resolution":{"observed_at":"2026-08-11T21:52:47.299924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.288259Z","title":null,"venue":null,"work_id":"77ff068c-c6af-448e-9c24-e3150f6dbe14","year":2008},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.648749Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:58bbf64f49c775e44cbb0b878e388bee8727abe2c50e142f90789dfd7727e61a","observation_id":"c158376c-d338-4abd-bb5c-d86afdf768c9","resolution":{"observed_at":"2026-08-11T21:52:47.291206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.651031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.651031Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:fd3ee2e4167af0786f8166cabea6d251520a05b359f838e2d6fbc8debebaf3e2","observation_id":"1a3353b4-ed23-4cc6-af43-da5789dcf9a6","resolution":{"observed_at":"2026-08-11T21:52:46.651031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.653247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.653247Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:e2c94148a05ea3db83bf99b3f6c60d9a1e8893ff50385cff8e47dd0d2c773b16","observation_id":"d1cd5326-80be-40fc-a6ee-5c223b18e4ac","resolution":{"observed_at":"2026-08-11T21:52:46.653247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.269679Z","title":null,"venue":null,"work_id":"0cc4c167-a69f-4c99-ab0e-d8ff5d8a041b","year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.655426Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:d94087a1ca87a19350980562039233cf19999cdf0e4b0fb05f9d883d0953cec4","observation_id":"b14cfb0d-ebe0-4162-8704-2a4a5b18830b","resolution":{"observed_at":"2026-08-11T21:52:47.272549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.260531Z","title":null,"venue":null,"work_id":"6d85e396-0102-4057-91bc-e6b54ea2eea1","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.657782Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:0cfc1138d1cf853c2793659b2cf3ff3e5edde5c3569fdd9e724a12edd1460900","observation_id":"f8ba0301-4ad6-4b6b-8bd7-8501b61d504b","resolution":{"observed_at":"2026-08-11T21:52:47.263710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.251284Z","title":null,"venue":null,"work_id":"c23eb21e-0dd5-4c20-9609-c04c317e5c7a","year":2005},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.660608Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:7cd609529bf6b8df7cda2959834582ed01a7bcf63a19e1e8505cb43865689aee","observation_id":"11f3f48e-f620-4b5c-8637-564527bb16fd","resolution":{"observed_at":"2026-08-11T21:52:47.254423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.242639Z","title":null,"venue":null,"work_id":"06fc9be9-62c8-4dcb-8ea9-9f9be7f6b289","year":1990},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.663393Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:1c54d29990e9909d01e9e09b89272217ea79e7caaa7341e7ec8753c3d92cb91d","observation_id":"c33c4c7b-42c8-4c14-9d19-a4e6bcd5a08f","resolution":{"observed_at":"2026-08-11T21:52:47.245614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.233134Z","title":null,"venue":null,"work_id":"ba437de1-d2d3-4dba-8a8c-67f84ff6ea65","year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.666194Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:c149dd271587a9af8790a059bcbee750bf1fc1a55980f92335689400822a5051","observation_id":"cf41f029-0f04-4549-8902-30435afd334b","resolution":{"observed_at":"2026-08-11T21:52:47.236707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-12T19:58:12.215146Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-11T21:52:46.668928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.668928Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:67ad3d35f3078f0c3c68c154cc4f1c352fe025a3c5bbbabecaa1d9cb7ad7aad0","observation_id":"feed3321-6448-48b7-8669-5dad2c2b300e","resolution":{"observed_at":"2026-08-11T21:52:46.668928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-12T22:09:32.316241Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-11T21:52:46.672138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.672138Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:e09c8c7b6a746200ce3278ff6042d604959ee476b98122543e46de28a9fa70ea","observation_id":"d7d58ca4-75b7-4ca4-a871-4ba3e0d811be","resolution":{"observed_at":"2026-08-11T21:52:46.672138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.223490Z","title":"Lin, Andy T","venue":null,"work_id":"bb58f488-5b2f-4ed8-8962-d494dad07251","year":2021},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.675213Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:d33f7422f02020e4fe9cabfd356a83720f82682702f511716cf953d095c8b6ec","observation_id":"8a0ee5bb-0be5-4f12-9cde-5177e6029105","resolution":{"observed_at":"2026-08-11T21:52:47.226547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-11T21:52:46.678289Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.678289Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:ef4eef1d32129a3459c37a051a6fe0525f6c5ec319ad102f02529382d83fe1de","observation_id":"67b5f46b-5c28-498a-8fc7-1ddb35b3f016","resolution":{"observed_at":"2026-08-11T21:52:46.678289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.681301Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.681301Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:4bfc9cc2252128f4735e2f01af76e1e582b8f5db8153208de6e853827f6d6a57","observation_id":"729ba4ee-a641-42f1-8399-b8dab5f67dec","resolution":{"observed_at":"2026-08-11T21:52:46.681301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-12T22:55:00.524050Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-11T21:52:46.684127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.684127Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:f8d38480668d5b81b09c6f2e4a91561638384c48378511e37e0b81e2a0de3ee2","observation_id":"3288e320-e98a-4755-8d5b-7275bfc6499a","resolution":{"observed_at":"2026-08-11T21:52:46.684127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T21:52:46.687195Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.687195Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:2daf4d6fea1bfb570ef92d46383ce5145e65cfda04dbc3307062cbdad7f27a6e","observation_id":"b40ac9f2-59a4-459b-8144-8dee267af72a","resolution":{"observed_at":"2026-08-11T21:52:46.687195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-11T21:52:46.690264Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.690264Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:25a927e2a87550feb70d1656ef1ed45bb74647febaf370251dfc015af3180cf0","observation_id":"ebb8583b-1a91-41c6-b3ca-4d5bcf5d9e18","resolution":{"observed_at":"2026-08-11T21:52:46.690264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17810","last_updated":"2025-08-10T12:34:42Z","snapshot_observed_at":"2026-08-07T17:51:23.956942Z","submitted_at":"2025-02-25T03:31:48Z","title":"URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17810","snapshot_observed_at":"2026-08-11T21:52:46.693385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.693385Z"},"links":{"cited_paper":"/paper/2502.17810","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:e80eaaca76f3ac106c9ccda48c2d43b2179c645e3619f9e0399f96c37e8977c8","observation_id":"3cd002c4-2767-4fa8-87b2-2f129d8ec2a6","resolution":{"observed_at":"2026-08-11T21:52:46.693385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T21:52:46.696430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.696430Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:c9e4b77f41684f4a5341826a704cf3c9746e0f0c047796b64c41775056c162a9","observation_id":"e0076c91-977f-42fa-9e8d-0d09a2cbfe2e","resolution":{"observed_at":"2026-08-11T21:52:46.696430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.213370Z","title":null,"venue":null,"work_id":"0a99193d-4a0a-407c-8503-baa69634b6b5","year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.699695Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:767ce137f1927025ad3c48f718523f6f5d8816f9c35800400ff55ce670b92fc3","observation_id":"1b3168e2-9674-4096-8f03-50bfaac808b5","resolution":{"observed_at":"2026-08-11T21:52:47.217349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:46.702563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.702563Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:77f15bffa1c413305cb7ec0fdc4234a2d9b48598155b82d440abb92d62998e3c","observation_id":"e1017416-761d-4238-b0b2-6d2fd41503df","resolution":{"observed_at":"2026-08-11T21:52:46.702563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-11T21:52:46.705383Z","title":"modality misalignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.705383Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:cc50817cb97188b6ee48dcd9fb0cb08c2dc4e17782907a1203fac93fda21ad7d","observation_id":"9515d57e-b62e-4052-85c9-8c62812abc88","resolution":{"observed_at":"2026-08-11T21:52:46.705383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:52:47.305631Z","title":"InICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"8efc3f16-84a9-4518-bb32-44da7eddd69f","year":2024},"citing_paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T21:52:46.639377Z"},"links":{"citing_paper":"/paper/2608.09189"},"observation_digest":"sha256:29ef49fda1845ac45dbeb8ed0d0ae989dfd147311f6354d9da23c9dfd383ee75","observation_id":"d9fcb904-03db-46a3-947c-dd2486a36f00","resolution":{"observed_at":"2026-08-11T21:52:47.309021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09189","last_updated":"2026-08-10T06:58:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:19:58.717352Z","submitted_at":"2026-08-10T06:58:30Z","title":"EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.09189."}