{"as_of":"2026-08-08T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc7d6ce486ba88e0bff0c579db9bec59927d234bd7863f63a70ea64f8a898156","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:41.673699Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:56:25.108341Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:4ec99957814b54eb4e0f0af16f8cd570433f97ff49a744d97f389720b3c61250","observation_id":"1a9a4096-7be8-487e-bd11-85d4f50bebe4","resolution":{"observed_at":"2026-05-12T18:57:28.714811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:75fb7a26f22168f40308f4e83b9cdba4e3003cf79bdb0b269765406868cf8863","observation_id":"8f19f970-ef08-4992-94ed-0e9b227a247c","resolution":{"observed_at":"2026-05-11T02:14:45.400835Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-07T11:58:41.673699Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-07T11:52:26.379256Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.673699Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:198814dd67edceff0775639f71c13dca28994443051c67e3bc8043d6f90b41bc","observation_id":"4e0f11e2-22a8-4db6-94d5-26769db66329","resolution":{"observed_at":"2026-08-07T11:58:41.673699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-06T10:59:01.261072Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23267","last_updated":"2025-07-31T05:56:21Z","snapshot_observed_at":"2026-08-07T23:41:26.871297Z","submitted_at":"2025-07-31T05:56:21Z","title":"Your Spending Needs Attention: Modeling Financial Habits with Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:01.261072Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2507.23267"},"observation_digest":"sha256:6fc5ad262c33399df4edd8f5c970c16467f8996617f1fb7a041487364ec299ac","observation_id":"08c2ee89-05c8-4112-bbd2-b3cc7cab53c4","resolution":{"observed_at":"2026-08-06T10:59:01.261072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-04T11:29:29.783850Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:29.783850Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:f7c800a35cc6cf2bf0037c624a7bae786ab4aa62706822dcd7119d6e3c719291","observation_id":"4cc58584-f19d-4b4d-8286-78ba2c0b84b0","resolution":{"observed_at":"2026-08-04T11:29:29.783850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2604.02374","last_updated":"2026-04-27T15:09:03Z","snapshot_observed_at":"2026-08-08T01:21:02.694310Z","submitted_at":"2026-03-31T20:35:26Z","title":"Evaluating Generalization and Robustness in Russian Anti-Spoofing: The RuASD Initiative","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T02:27:05.776290Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2604.02374"},"observation_digest":"sha256:ea0837f4046311c5bb84a4cbd82f37c10f37e4ca72b4b73a53039addd031f316","observation_id":"d9642255-09a9-46d6-807c-b1e781165aed","resolution":{"observed_at":"2026-05-11T22:46:12.434663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T23:00:35.099926Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:ee32c7820008bc114d5f1f31745dba4bf2f70a16b9f1b11ccbb8340fe7ff8548","observation_id":"731d1eee-03d8-462a-b9b5-bc1eae320375","resolution":{"observed_at":"2026-07-02T00:56:25.110474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2110.07205/citation-record","integrity":"/paper/2110.07205/integrity","json":"/paper/2110.07205/citation-record.json","paper":"/paper/2110.07205"},"outbound":[],"paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2110.07205."}