{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9afe31df44e80b923de650546565a9431fc7cbd98f52ff82cbd00d5fe353dd80","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:02:03.077732Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:31.523597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:19:02.942476Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-08-03T06:36:31.523597Z","title":"Tts-1 technical report.arXiv preprint arXiv:2507.21138,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.523597Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:e7407946e83e90b39e92f262ce9655e0cbc1bb4648140557bc94e4d26dc4f6fe","observation_id":"64fed19a-4d58-49a6-867f-8977988efecd","resolution":{"observed_at":"2026-08-03T06:36:31.523597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-07T06:34:45.357695Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:6ce68ffddbb3fe5cae00b67f4465bda7875c99b00eb5e3d220bc520b75cc1f91","observation_id":"b76085d3-b265-4c38-beb9-aa07f37b5812","resolution":{"observed_at":"2026-05-12T10:21:28.850669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T03:09:24.541657Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:be08a18e2375077612a4c7a829eb13f6a3cb0c968a74029263b37c12f54defb8","observation_id":"cca52b6c-b63b-414c-9517-cb5c8bc46c2a","resolution":{"observed_at":"2026-05-11T22:16:26.706638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-06T02:49:06.057401Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T22:46:47.786929Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2606.18323"},"observation_digest":"sha256:d3db8e3831fa0be52fd1b89688bdb980fe9d631235ec9dffa5e742287ee488c1","observation_id":"cc3f5c45-0029-4f23-a0c6-f49bfa10d585","resolution":{"observed_at":"2026-07-03T23:19:02.945574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21138/citation-record","integrity":"/paper/2507.21138/integrity","json":"/paper/2507.21138/citation-record.json","paper":"/paper/2507.21138"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T15:02:02.830714Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.830714Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7952e7bcc595ef9281ebd48ef90772eee0d064351621dd8bff9a07e4f7566c75","observation_id":"1116d9ff-1bb6-45fe-8c3b-2d690506a98d","resolution":{"observed_at":"2026-08-06T15:02:02.830714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.053088Z","title":"Yodas: Youtube-oriented dataset for audio and speech","venue":null,"work_id":"d1749849-d565-4027-88d4-a2704aa29075","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.837634Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:58d12f0dad4516b06ac73c04fb9a0916b9d3d875f94a58f7ba581edf98845a52","observation_id":"b6165c63-f5b3-490c-908c-7f7aa6a4e881","resolution":{"observed_at":"2026-08-06T15:02:04.059235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.035830Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"bd375b7d-1170-4423-92ef-2b8c590866dd","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.843161Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:35791ee39fc9fdb1aec20c265b8a7eda8e344bba52b663572db9c6b7e858f19f","observation_id":"9a8e03bc-ef3b-494a-8385-5600549cb4dc","resolution":{"observed_at":"2026-08-06T15:02:04.040769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.020387Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":"f14311f5-fdef-44b2-bffa-eaa4b67a7585","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.847985Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:e5c825bd923759c625e7ba4a5dbe33db4c811c2857f1c8c84d741cfcfa0578cf","observation_id":"a5392520-ba95-430c-a8b1-d442e5564146","resolution":{"observed_at":"2026-08-06T15:02:04.025179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.002310Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"2d921ab7-8c22-4405-a2ce-37c5c901bb71","year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.854081Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:66c9d26dac0da5a03e2688e5e66fbdbf93a1df5d493d16dcde2e510f12f478e3","observation_id":"d993e778-bc6a-4974-a47b-8ab4e75e5f8b","resolution":{"observed_at":"2026-08-06T15:02:04.008207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T15:02:02.858858Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.858858Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:96bdf7e1f4f8a51cf683935ac0f02e6a4f391e21aea9b0e3432ee91f1b446a4c","observation_id":"448ecfc7-dea8-42b5-b8e6-c5ee136542be","resolution":{"observed_at":"2026-08-06T15:02:02.858858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.982157Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"35fc0556-114f-46d8-a8ad-90007def35a5","year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.865173Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:20f61666d015e95d33fb34944750d42f4fe12682b09f43a1509777e338f14eed","observation_id":"e9573b28-862d-43f8-928b-4878a58d2629","resolution":{"observed_at":"2026-08-06T15:02:03.988145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.958810Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"3adabe5e-77b9-40b2-b4d2-d5787b0e4985","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.870328Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:f1e69ff6585468e6f473133be53f0d31f24e67de77d9ed88dd23b9bce8ae5405","observation_id":"e204a9e3-3816-48fe-84cf-4e4f73ff3a0c","resolution":{"observed_at":"2026-08-06T15:02:03.965541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.875785Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.875785Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:4e523e0f9317ba507c0b5555c0a8b7f5ec6ef3f71a2612015b338b0e18b8c2b4","observation_id":"3fb837f9-85f5-43b5-add2-e03a99597d36","resolution":{"observed_at":"2026-08-06T15:02:02.875785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T15:02:02.880909Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.880909Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:19d10d6159aa13ff23a8da7fea8dbb2231b696a6854b5f6dab9bd06a00ca93b1","observation_id":"7c2d9832-c784-4272-b9a4-311689e7b0d2","resolution":{"observed_at":"2026-08-06T15:02:02.880909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:02:02.886470Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.886470Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:e722ddd35223fdea5de0db0c4d1ffb81efdbfb8dc67b0cefede81b105c92ef97","observation_id":"d96c6f96-d5ae-4aa6-b75b-63251abf5781","resolution":{"observed_at":"2026-08-06T15:02:02.886470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-06T15:02:02.891456Z","title":"Minimax-speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.891456Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:6c1804a5c769a2296ff9cdd549e2877afea2d3cb729b3478bd9949cbaa5b2047","observation_id":"bc5e8aef-029b-4609-8889-5fef279eb141","resolution":{"observed_at":"2026-08-06T15:02:02.891456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:02:02.897698Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.897698Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:a5e36f2b5c770dc27ca85b8f175dbb0796b0bf412b2f4cd81565c717dc05b767","observation_id":"aed9d272-a437-42ff-bec8-c77046dd3603","resolution":{"observed_at":"2026-08-06T15:02:02.897698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T15:02:02.904024Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.904024Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:4963e0cbcb7fb3c2c932c229ba172508c8b124379011f9cc1d9e778f5f4a70e4","observation_id":"a3c777f1-cd98-4493-aae4-b99d5ea637dd","resolution":{"observed_at":"2026-08-06T15:02:02.904024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T15:02:02.908687Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.908687Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:020d5ddc55cf565b5d7313ced7ed80b43303c56eb421b7f9b450040694991f88","observation_id":"a2cd3a78-d85f-44a1-9c4b-f1c80281eac1","resolution":{"observed_at":"2026-08-06T15:02:02.908687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.918911Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"59526fef-00fe-4a91-9fef-2f02500b847f","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.913946Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:93e37fcf9fcfc51753fe9adce45bfa7e58725f705eb74ec4ce6d5b13d7c97852","observation_id":"bd31abf3-cdc3-4957-9bde-e4ca9251251f","resolution":{"observed_at":"2026-08-06T15:02:03.926487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.898243Z","title":"Open instruction generalist (oig) dataset","venue":null,"work_id":"2d17ab72-2e0a-4e76-a441-508c2692deda","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.919362Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:ce94fb166c496ae738cecf16885b9a035aa05cdc82daf3b4ccd63b198d4a813f","observation_id":"669d28f8-b554-4228-a0ee-fdb73850def1","resolution":{"observed_at":"2026-08-06T15:02:03.903451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:02:02.924574Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.924574Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:a57e7012dd0cc922efad418064311334f03d7dafc14d549e7c1b24c8e1e62068","observation_id":"1f6b538f-24df-4cef-b876-74eb4f3f71dc","resolution":{"observed_at":"2026-08-06T15:02:02.924574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T15:02:02.930108Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.930108Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:cb33c2901c6f46b7f573efefca96677faad752d84fe59a6c4eadc9db7e051a09","observation_id":"5a853971-6149-46e6-9863-4098efe1267e","resolution":{"observed_at":"2026-08-06T15:02:02.930108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.878699Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"23caf953-16f2-4d2b-b300-c6aa33e64540","year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.935030Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:dd7f42c9b0b4297818084871e43388dbde6ed8bf9776369972fb28e1f1673168","observation_id":"61e20d6f-5552-4c0c-a9a8-b4a2d805e76e","resolution":{"observed_at":"2026-08-06T15:02:03.884270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.860444Z","title":"Dnsmos p","venue":null,"work_id":"65214b12-41ce-4ab0-b955-b90d01231edf","year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.940134Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5b3285ce2d52751c3ec28cc652810c3aea2cf850185364ddd640c73139e8a2d5","observation_id":"befd186d-6c49-493d-8b30-f788cea54faa","resolution":{"observed_at":"2026-08-06T15:02:03.865444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.944597Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.944597Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:36f7fc458ea231fcb09d6218b9add01878e283424aa92e7eb141026af937b19e","observation_id":"3d900436-35b3-4f17-b713-eba6b6f78fa3","resolution":{"observed_at":"2026-08-06T15:02:02.944597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.949788Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.949788Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:a676074fd1326b39962c3224e08ef81a60e9a27107ea39849d12827f82cf2d28","observation_id":"bdf5b87d-9598-4cab-88a2-5c88c38d010a","resolution":{"observed_at":"2026-08-06T15:02:02.949788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:02:02.954136Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.954136Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:90bab65e90c327391cadc726d7c4a5e0bdf3f723ce005811251a44da3c2d8fdf","observation_id":"089d6aab-8a5f-4074-bdbd-071b1dd9a10c","resolution":{"observed_at":"2026-08-06T15:02:02.954136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.819896Z","title":"Matrix multiplication background user’s guide","venue":null,"work_id":"08cfe823-9f35-4edc-8485-14ef0529890e","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.959872Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5924a0d7cb1dcd6814682789cb83a7476a03daee96fc5a8e843fee5272ebf66d","observation_id":"6e452096-9f3d-4855-8a96-101daea28de3","resolution":{"observed_at":"2026-08-06T15:02:03.825369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.800541Z","title":"Initializing new word embeddings for pretrained language models","venue":null,"work_id":"92f0c606-dc75-4c0a-890f-078949ea652a","year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.964733Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0ff1ed5e9cee1ad935826923d3378a5e888b3d8e68869199cce3c820958232e5","observation_id":"63165417-09a3-4464-b43e-d01040b7e49f","resolution":{"observed_at":"2026-08-06T15:02:03.808174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-06T15:02:02.970136Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.970136Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0afc670f9b38b20a993324baa02c9475c6de777cccb01822f1af24ab1a9ac15d","observation_id":"dee61c16-a693-413d-baec-a8d71bc82094","resolution":{"observed_at":"2026-08-06T15:02:02.970136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.782568Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"1c655ea5-09af-41b2-a972-998f3d9b4ed3","year":2020},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.974412Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:4704a241de8885f68c8c8001afeaed4174779693af5ed63fe553fe3b6af12b71","observation_id":"e7372153-22da-4005-9a06-a28caf869736","resolution":{"observed_at":"2026-08-06T15:02:03.788491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T15:02:02.980832Z","title":"High fidelity neural audio compres- sion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.980832Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0ca2b0e1c5db43a5833377ab100ca4df666c89eb0d3825a34c674dd8f74ad3dd","observation_id":"331a3e81-ee3b-4418-9bf2-aac95671b668","resolution":{"observed_at":"2026-08-06T15:02:02.980832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07388","last_updated":"2023-02-14T23:00:42Z","snapshot_observed_at":"2026-07-06T14:51:56.435442Z","submitted_at":"2023-02-14T23:00:42Z","title":"Adding Instructions during Pretraining: Effective Way of Controlling Toxicity in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07388","snapshot_observed_at":"2026-08-06T15:02:02.985709Z","title":"Adding instruc- tions during pretraining: Effective way of controlling toxicity in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.985709Z"},"links":{"cited_paper":"/paper/2302.07388","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:fe9a0fbe73118c9f1d15a87767eec9adcf8bb4cd9724a01154536c896663049b","observation_id":"dfac856f-3877-4bf0-9bdb-d925ad897b44","resolution":{"observed_at":"2026-08-06T15:02:02.985709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.990541Z","title":"A neural probabilistic language model","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.990541Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7a552087492b76912db66955df62cf8b39013b20bf614c59275cbd40baf574bd","observation_id":"b2d0e952-b052-4dc2-8a25-3c9367e1cfe1","resolution":{"observed_at":"2026-08-06T15:02:02.990541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T15:02:02.997072Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.997072Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:337ff214d515efea43f47d711300e2f187130ce8cb883a408a0d4011b779ad85","observation_id":"9133858a-f8b9-420b-8e82-19916efa00be","resolution":{"observed_at":"2026-08-06T15:02:02.997072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T15:02:03.001891Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.001891Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:40f0b25c844704f53e46c0516dd2d3ecd41ceed48440598579236bf82e93b061","observation_id":"29c6c949-fa70-4f7c-8811-4deab52cb8f1","resolution":{"observed_at":"2026-08-06T15:02:03.001891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-06T15:02:03.006360Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.006360Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:79c9de75bcf20797f33f0164b79363c10184eb34ae927bc2d413511529908a9c","observation_id":"dc53bb10-0b74-41a7-93a0-bac436025d36","resolution":{"observed_at":"2026-08-06T15:02:03.006360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T15:02:03.011140Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.011140Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:68863d5a348877fc6e73ee44c41a6b31f7507a8b30ebf6c660022a54912640b0","observation_id":"d962fbbe-3828-4961-9347-cf0e52fb0db0","resolution":{"observed_at":"2026-08-06T15:02:03.011140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.749862Z","title":"Parler-tts","venue":null,"work_id":"75cd84b5-7d47-4007-a2e2-5adbd5461c4c","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.016065Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0c02eeb8d21c16981f8ef400a29100225da9d071a1b957721074c17ac1905bfa","observation_id":"e27dba3b-4a19-4c67-a1b4-2ed803652cb5","resolution":{"observed_at":"2026-08-06T15:02:03.755019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.732486Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"4c1103a0-443e-4513-9ff9-def22617607f","year":2020},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.021572Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:64297bd439a94d4748278022bb8a6fa084a14d608631e0aad0462dd6d16ba38d","observation_id":"8a5c05da-c5d0-4796-bf6d-9303960c483b","resolution":{"observed_at":"2026-08-06T15:02:03.737535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-06T15:02:03.026897Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.026897Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:42b36cd8a9b1e4c465b7effc5c4aefdf08f11428247ad26365215da4ee7e5fbe","observation_id":"52ded5a3-2265-49cd-b401-61758dbf0392","resolution":{"observed_at":"2026-08-06T15:02:03.026897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T15:02:03.032073Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.032073Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:e76746db0c18ea8061d4ba6300ccb3bc513793b66356e9f68daf3cb6e386faea","observation_id":"3640e72a-bbf6-47a0-89f5-b238dca3c766","resolution":{"observed_at":"2026-08-06T15:02:03.032073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T15:02:03.037268Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.037268Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:b7481e384b327aebf694ef8f489b32c6945a49d08012d8a3277bf4b091d0480f","observation_id":"4a88a8cd-6997-471a-8f21-bc960cf587e3","resolution":{"observed_at":"2026-08-06T15:02:03.037268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T15:02:03.042360Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.042360Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:ceb8fcc27c9006379dd77cf62cb18e9b13e02f2c1c2f0a624e51317b9fc47dc7","observation_id":"63c76d66-c01b-4edd-9a8a-2caebbdb197f","resolution":{"observed_at":"2026-08-06T15:02:03.042360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.047248Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.047248Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:be2521821abccab1ecefd0719fd5825060fe2d7756384ad84af932c55fea1ee4","observation_id":"4ca58588-1f1f-4943-8194-60f8dbc61c15","resolution":{"observed_at":"2026-08-06T15:02:03.047248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T15:02:03.052195Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.052195Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:d2c23d2239126a359d88ce24fbe9e59be9eaa85497212781f98eaf1512a6fda0","observation_id":"f720f069-b85f-48e8-afe8-ae422da1397e","resolution":{"observed_at":"2026-08-06T15:02:03.052195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.057567Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.057567Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:9b647ceef7b24d31c3f33f4f5a7ca4d9f03ad1a880c4801e0661029267134a74","observation_id":"b9b904ce-8b94-46ad-9c3d-99590258e76e","resolution":{"observed_at":"2026-08-06T15:02:03.057567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T15:02:03.063141Z","title":"Huggingface’s transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.063141Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:fffa2e6a092c59591549bf81acfd0f264cc3506d9f84d7b1b1b59aa4b626ef1d","observation_id":"6d2518ba-0c5b-4908-ace2-7d94f7171699","resolution":{"observed_at":"2026-08-06T15:02:03.063141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T15:02:03.068483Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.068483Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:562ec43d0510f79d1de25260599007598817210c9725a60e853d25dfe944321b","observation_id":"bd80dfc2-0d2c-400a-818f-ebd963c3eeab","resolution":{"observed_at":"2026-08-06T15:02:03.068483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.685955Z","title":"Pytorch lightning","venue":null,"work_id":"141d0e84-9e1e-4193-8397-774f1b8ebfe7","year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.073406Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:b1da5b934a23071e68379aaa2a71c7ade41c02f2c48d24e802f104004da34e34","observation_id":"a606eda4-cfd8-44ee-85bf-7b99585a2b9b","resolution":{"observed_at":"2026-08-06T15:02:03.690672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.667856Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"872d65f1-7a2c-46b1-a7a2-8e6d6f976a1b","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.077732Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7c89ec3559d22ea5483877d2ad07d59cf904a17d9a1d1d185dd3fedda997743b","observation_id":"c88b760d-9f09-4e4e-a31c-fb9f6ae7cc7b","resolution":{"observed_at":"2026-08-06T15:02:03.674403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T14:54:51.628383Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2507.21138."}