{"as_of":"2026-08-04T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:353ba6760fd05de11d1c768de5481b027baa40a79b3c76e76240c6bc161ad0ea","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:47:56.699537Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:47:56.579355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22503","snapshot_observed_at":"2026-08-03T19:47:56.579355Z","title":"Everybody has a master is out here oh yeah well it seems […]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.579355Z"},"links":{"cited_paper":"/paper/2511.22503","citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:5d8745de2ef2f7077d005b2d3bfe589a46361ec29efb4931fd4ae9b43eabc2b4","observation_id":"8191766c-8e97-48b7-971f-444079033dd9","resolution":{"observed_at":"2026-08-03T19:47:56.579355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.22503/citation-record","integrity":"/paper/2511.22503/integrity","json":"/paper/2511.22503/citation-record.json","paper":"/paper/2511.22503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.574437Z","title":"Yes, it should leave on Sunday. It should leave after 13:45","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.574437Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:56e6792e42dc9d7d40202fab5bff5b0c65bc44426229aadf6d0b8e89dea0f9b7","observation_id":"93e3398d-6af1-44de-af20-5c5cc903edc8","resolution":{"observed_at":"2026-08-03T19:47:56.574437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22503","snapshot_observed_at":"2026-08-03T19:47:56.579355Z","title":"Everybody has a master is out here oh yeah well it seems […]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.579355Z"},"links":{"cited_paper":"/paper/2511.22503","citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:5d8745de2ef2f7077d005b2d3bfe589a46361ec29efb4931fd4ae9b43eabc2b4","observation_id":"8191766c-8e97-48b7-971f-444079033dd9","resolution":{"observed_at":"2026-08-03T19:47:56.579355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.583676Z","title":"Datasets and metrics We conduct our experiments on two spoken dialogue state track- ing datasets: SpokenWOZ (SW) [9] and Speech-aware MultiWOZ (MW) [18]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.583676Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:7eed981a3c7e45f9ae3b3e153fe2e25297f0e5d35ba7951220d363c76a5eaace","observation_id":"7a376516-fdf0-4938-9555-c8c08bc7e277","resolution":{"observed_at":"2026-08-03T19:47:56.583676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.588192Z","title":"Our method entails augmenting an LLM-based spoken DST model with a text encoder which allows the model to be trained on arbitrary textual DST data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.588192Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:08887609c0ff45e035c03d5b109694f5bbf1024dda39e7f9e6e7015271c8e47a","observation_id":"e80fb12a-fa3a-4f20-b16a-d1472a79c48a","resolution":{"observed_at":"2026-08-03T19:47:56.588192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.592298Z","title":"DSTC-11: Speech aware task- oriented dialog modeling track,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.592298Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:5bf4acd1ac9990544564582fa5dff26e99824248ab0798569c110b7f097d5cd2","observation_id":"cc688e99-edee-4fd0-b82f-4eff88aaf8b0","resolution":{"observed_at":"2026-08-03T19:47:56.592298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.596164Z","title":"Speech-aware multi-domain dialogue state generation with ASR error correction modules,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.596164Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:2d7301845d4e1d7b200d70dd417fb5c283d03842768a2b2836af17cdfe4c0759","observation_id":"729913ff-8581-4041-94ee-67105f6e3ed1","resolution":{"observed_at":"2026-08-03T19:47:56.596164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.600050Z","title":"Adapting text-based dialogue state tracker for spoken dialogues,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.600050Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:409017d1a470c8b4540c842e8e15979da1fc0021227beb8ded985f2809f5a184","observation_id":"f52bc99c-842c-4673-8319-63082f96d1d2","resolution":{"observed_at":"2026-08-03T19:47:56.600050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.603712Z","title":"Integrating dialog history into end-to- end spoken language understanding systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.603712Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:f65035289eea7628349d4efcc98f376b5c0823646adabdab1ea52ce90ac03532","observation_id":"c96a3d31-a0b2-422b-b271-0c93d11b6404","resolution":{"observed_at":"2026-08-03T19:47:56.603712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.607524Z","title":"ConvKT: Conversation- Level Knowledge Transfer for Context Aware End-to-End Spo- ken Language Understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.607524Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:6a24247148bf14e8b7cd1763939ae4bbb1d319b86a093b551c84788e347cf035","observation_id":"6a1bbaca-6878-43ed-a9f0-dde826cd7758","resolution":{"observed_at":"2026-08-03T19:47:56.607524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.611698Z","title":"Retrieval augmented end-to-end spoken dialog models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.611698Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:a5442c650ffff0e1fa05e5d6d52f6ee1f6fa360b1e8b5cc44c3d7d72ebaade26","observation_id":"8cbe0a28-a281-4d98-b44a-e0d28b33c170","resolution":{"observed_at":"2026-08-03T19:47:56.611698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.615348Z","title":"Approach- ing Dialogue State Tracking via Aligning Speech Encoders and LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.615348Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:429a4e0cec1d6afedbf73612d541bbc755e045b15bed3e55a204d41df0a617f6","observation_id":"74226d3f-3d48-49cc-8cf7-6bd93b34931e","resolution":{"observed_at":"2026-08-03T19:47:56.615348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.618949Z","title":"LoRA: Low-rank adaptation of large lan- guage models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.618949Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:83ce257a78cdeb1e8d0b7862086479bdb43dd2d1e0da8b971bc74c8c4f1ba785","observation_id":"ca3ae4dc-d23a-40bb-95a1-6c39c6034c51","resolution":{"observed_at":"2026-08-03T19:47:56.618949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.623018Z","title":"SpokenWOZ: A large-scale speech- text benchmark for spoken task-oriented dialogue agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.623018Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:b4768b2cd05a1188a23768f70bfd5aff88c02f2e56028350cc54ef3462366959","observation_id":"977b009d-aab4-4486-883c-e1e358728880","resolution":{"observed_at":"2026-08-03T19:47:56.623018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12441","last_updated":"2021-12-23T10:04:25Z","snapshot_observed_at":"2026-07-06T12:21:52.773404Z","submitted_at":"2021-12-23T10:04:25Z","title":"TOD-DA: Towards Boosting the Robustness of Task-oriented Dialogue Modeling on Spoken Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.12441","snapshot_observed_at":"2026-08-03T19:47:56.626867Z","title":"TOD-DA: Towards Boosting the Robust- ness of Task-oriented Dialogue Modeling on Spoken Conver- sations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.626867Z"},"links":{"cited_paper":"/paper/2112.12441","citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:20d619497f9c35b7faa0f01aa1aa5a810653c0436dcbaaedeaaa30afb72e3796","observation_id":"ca230d4a-67ab-4cb2-919e-b15c4443630d","resolution":{"observed_at":"2026-08-03T19:47:56.626867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08844","last_updated":"2021-12-16T12:51:52Z","snapshot_observed_at":"2026-07-06T12:19:33.825116Z","submitted_at":"2021-12-16T12:51:52Z","title":"Adapting Document-Grounded Dialog Systems to Spoken Conversations using Data Augmentation and a Noisy Channel Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08844","snapshot_observed_at":"2026-08-03T19:47:56.630991Z","title":"Adapting document-grounded dialog systems to spo- ken conversations using data augmentation and a noisy channel model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.630991Z"},"links":{"cited_paper":"/paper/2112.08844","citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:81615bdace88294b4c0e95bb3a80986ca2e1619ef4fc2cd077fe71817adeb4b9","observation_id":"39091302-9338-4671-a2c5-7b3b6c44e8c4","resolution":{"observed_at":"2026-08-03T19:47:56.630991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.635064Z","title":"Improving speech translation by understanding and learning from the auxiliary text translation task,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.635064Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:a14032cc2831b856576d2abec2a57a3aec606213a3babc14278669ef1af45536","observation_id":"0f4d0909-8f26-4439-a94c-a67a634a920e","resolution":{"observed_at":"2026-08-03T19:47:56.635064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.638813Z","title":"MAESTRO: Matched Speech Text Representations through Modality Matching,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.638813Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:c495fbf7053ff4458663eb04b6a72e0c6c4c82999fb76ef47a4930aa9895a42e","observation_id":"df76d3d5-0dfa-4233-97a2-1d288580c019","resolution":{"observed_at":"2026-08-03T19:47:56.638813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.642577Z","title":"USTED: Im- proving ASR with a unified speech and text encoder-decoder,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.642577Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:898e4b381d08fad90f431053bbdd2446a7f911906217e7e70ab1d613eb5f2a4d","observation_id":"5aa1fd84-c75b-4aee-8367-c2713c17aba5","resolution":{"observed_at":"2026-08-03T19:47:56.642577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.646424Z","title":"Towards reducing the need for speech train- ing data to build spoken language understanding systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.646424Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:7634b0ab0be6d01060ed2e035414dc7b7663097ded3a3f47add1e3d8f4e93dfb","observation_id":"8dbb5cfd-5990-4a99-9c4f-3080866bdcd6","resolution":{"observed_at":"2026-08-03T19:47:56.646424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.649965Z","title":"Written Term Detection Im- proves Spoken Term Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.649965Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:69196018bae4af8fef806d721c7e4841e8e7c09fdee7083237e5393634045ebe","observation_id":"91b06d8f-c045-4361-9b17-b0af15e4e040","resolution":{"observed_at":"2026-08-03T19:47:56.649965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.653977Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.653977Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:34119c69a274d10b01bb2841264475bb926eddc12d2615deddc6af1fe6f460c7","observation_id":"c4117232-0648-43de-b9f9-49d7cb57a14f","resolution":{"observed_at":"2026-08-03T19:47:56.653977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.657564Z","title":"Speech Aware Dialog System Technology Challenge (DSTC11),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.657564Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:be6398fdfec451745ce2184067b616856979881f5e15db9f4f2ab60f8a5708d0","observation_id":"d770fe73-ab83-42f7-bd3d-29b0372f3bd6","resolution":{"observed_at":"2026-08-03T19:47:56.657564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.661163Z","title":"DialogStudio: Towards richest and most diverse unified dataset collection for conversational AI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.661163Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:a43add2daa1b3a6bf22ddc7c1e37b652527734b7ce5f211edd82c2855d56b456","observation_id":"fa66c21a-37f9-4a9f-b6ea-0a8f897203d0","resolution":{"observed_at":"2026-08-03T19:47:56.661163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.665281Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.665281Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:8f1da2255a223c06ae4bd2d61e9a50dec9a7dd07eea0814e85d0d547f61e7d89","observation_id":"0ac202f4-4c05-4e55-a687-0f0a01473de3","resolution":{"observed_at":"2026-08-03T19:47:56.665281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.669137Z","title":"The Fisher corpus: A resource for the next generations of speech- to-text.,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.669137Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:b4d75984774a1ee92389460c5319f7e48c849bcf050315fd09119874550090ba","observation_id":"a48a7371-926d-4918-9521-c60f54ea2fb3","resolution":{"observed_at":"2026-08-03T19:47:56.669137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.672719Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.672719Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:0a5bf27f3c8f708cf8a3282da07992fef53a4014da5c36a1e7e1c0b740e3e09f","observation_id":"ab7c4be8-a18e-42d9-84bb-e5f7eb4fd637","resolution":{"observed_at":"2026-08-03T19:47:56.672719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.676528Z","title":"Common voice: A massively- multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.676528Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:8c159061c79da16854f158dedb6909cf196ecf576519f125f5bec8f7a8458f6c","observation_id":"8144f519-cbf8-48b8-b79c-6bfe4a976925","resolution":{"observed_at":"2026-08-03T19:47:56.676528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.680030Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.680030Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:46909d024151c3d1803c21af67120b4891c8f4f615349d2ad9cb50c1ac8b100a","observation_id":"28a73f5e-a951-4c42-b712-797a4d8e74f2","resolution":{"observed_at":"2026-08-03T19:47:56.680030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.684140Z","title":"Shades of BLEU, flavours of success: The case of MultiWOZ,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.684140Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:69d02861dca066372acac10131437d94b6d50f64627a7d2804d580045cc10189","observation_id":"fbe8ff7f-da12-4594-ae09-e258b85409d8","resolution":{"observed_at":"2026-08-03T19:47:56.684140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.688054Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.688054Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:50bdddc606ef3c84fa7e115f3b61c2eb07b661c70d6dda78183cf3db9292a10a","observation_id":"c312572f-0dd8-4765-97f5-8625c7f25489","resolution":{"observed_at":"2026-08-03T19:47:56.688054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T19:47:56.691737Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.691737Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:5602e15c8f57fed20c71f09deb0c3371836eec3558547bbc88c0f51b323f31e6","observation_id":"69f8e056-78f1-4032-a6c6-63446b6538fd","resolution":{"observed_at":"2026-08-03T19:47:56.691737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.695821Z","title":"Olmo: Accelerating the science of language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.695821Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:23657b7b284b9f34bbe9d36f1e48dbe8250b2bfd149f4213a59dcd62e55d803f","observation_id":"74b44d47-de23-45f8-8fa0-d07b3c5bed58","resolution":{"observed_at":"2026-08-03T19:47:56.695821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:56.699537Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:56.699537Z"},"links":{"citing_paper":"/paper/2511.22503"},"observation_digest":"sha256:7c35a052cd02cdbdf4e3a9b078d9788dffab28361f3a25e251813c6e2f4272c3","observation_id":"74b589e6-8322-4669-92a8-9172f333b24f","resolution":{"observed_at":"2026-08-03T19:47:56.699537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.22503","last_updated":"2026-06-19T17:52:00Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T19:47:56.303668Z","submitted_at":"2025-11-27T14:36:48Z","title":"Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2511.22503."}