{"as_of":"2026-08-08T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9020746d00fff65a3bf8bcf1f376f07eaf9b6615e5d825ead553630017f9ae76","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:32:33.180493Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2504.13102","last_updated":"2025-04-17T17:11:32Z","snapshot_observed_at":"2026-07-06T21:11:05.749637Z","submitted_at":"2025-04-17T17:11:32Z","title":"A Multi-task Learning Balanced Attention Convolutional Neural Network Model for Few-shot Underwater Acoustic Target Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T19:00:17.697217Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2504.13102"},"observation_digest":"sha256:e13ae042e82c32fa359b24e819c20eaa1389930f735664c64c73ab651c97f91e","observation_id":"48d44a37-312b-4421-a845-c9f38f110ee0","resolution":{"observed_at":"2026-05-22T19:01:57.741067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-07T13:32:33.180493Z","title":"Cam++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21445","last_updated":"2025-05-27T17:16:59Z","snapshot_observed_at":"2026-08-07T13:25:17.303544Z","submitted_at":"2025-05-27T17:16:59Z","title":"VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:33.180493Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2505.21445"},"observation_digest":"sha256:4efec7f12a36c174718c91196c0a0937a3fe39145353ae97f9c24fccd357e84a","observation_id":"e320bea5-6e39-462c-a823-256f39134ddf","resolution":{"observed_at":"2026-08-07T13:32:33.180493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-07T12:55:24.199871Z","title":"Cam++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23207","last_updated":"2025-05-29T07:47:48Z","snapshot_observed_at":"2026-08-08T12:28:17.887912Z","submitted_at":"2025-05-29T07:47:48Z","title":"Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:24.199871Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2505.23207"},"observation_digest":"sha256:a07f2f4e1c5753e33b985ebaaf5549d1c47f7e20fc6e56bbca6e3e7f1126955e","observation_id":"e3a807a5-cb05-448e-beb9-10498a10e830","resolution":{"observed_at":"2026-08-07T12:55:24.199871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-07T00:40:51.583965Z","title":"Cam++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13300","last_updated":"2025-06-18T06:57:58Z","snapshot_observed_at":"2026-08-07T00:34:30.814768Z","submitted_at":"2025-06-16T09:42:05Z","title":"Seewo's Submission to MLC-SLM: Lessons learned from Speech Reasoning Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:51.583965Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2506.13300"},"observation_digest":"sha256:dd180c2021e030b76b98fdcbe148cb660515563eadebf1585af47371531621d8","observation_id":"23f45442-877c-47ea-b01a-055032f9d6d4","resolution":{"observed_at":"2026-08-07T00:40:51.583965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-06T11:22:10.032757Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.032757Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:666d59a5cf306a28622d8071bd0096e99b8dfe3116ded38bf3cf25f1ad85fbca","observation_id":"1171e4f6-1351-435f-ae4e-ac3f5ac56389","resolution":{"observed_at":"2026-08-06T11:22:10.032757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T14:22:47.686311Z","title":"CAM++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21407","last_updated":"2025-08-29T08:27:17Z","snapshot_observed_at":"2026-08-08T10:51:56.221431Z","submitted_at":"2025-08-29T08:27:17Z","title":"DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:47.686311Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2508.21407"},"observation_digest":"sha256:1de6cfc26a206d69776d2aebef5b8f122a9c2333da516ac88a2c51d4cee0bd04","observation_id":"30aa2119-5b56-43ca-b1f6-497c92a57ab1","resolution":{"observed_at":"2026-08-05T14:22:47.686311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-04T18:29:41.653077Z","title":"CAM++: a fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09932","last_updated":"2025-09-12T02:34:25Z","snapshot_observed_at":"2026-08-08T06:19:00.224743Z","submitted_at":"2025-09-12T02:34:25Z","title":"Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:29:41.653077Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2509.09932"},"observation_digest":"sha256:3dd42251e81ab12682c6f46ef2211b6f3f71a18922b0d7853d61d5fea2d7b07a","observation_id":"81c03d8f-5cba-4908-9af8-282172876454","resolution":{"observed_at":"2026-08-04T18:29:41.653077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2603.09677","last_updated":"2026-04-08T07:57:35Z","snapshot_observed_at":"2026-07-06T22:48:30.706783Z","submitted_at":"2026-03-10T13:46:32Z","title":"Logics-Parsing-Omni Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T13:37:44.189839Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2603.09677"},"observation_digest":"sha256:005583aa900af5ca8e7e90524a2425964f36525ceea668376775bd7d9bf2665c","observation_id":"32da00fe-042d-4ab6-b446-69f2dc58c249","resolution":{"observed_at":"2026-05-15T13:40:01.757425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:069a17e19ee82298258f6c4a97cef41a5ec6b6ae24d07a5ac887a195a6ec4567","observation_id":"99df1911-2c91-4c2a-862f-c308e9aada21","resolution":{"observed_at":"2026-05-10T23:50:51.793968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:3d3769571a035e999b7a2bf487a9df5162c07d6f273fa47a5767efaaccc107e3","observation_id":"899481e7-e519-45d9-998e-318cbbf2727c","resolution":{"observed_at":"2026-05-11T04:50:56.052673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:974fa524c597463bdda4ed13750c185dbfa66f992a3ebe21e3285480df183712","observation_id":"b8ce56cf-20b4-4b4f-9127-c046beb3624c","resolution":{"observed_at":"2026-07-01T20:26:13.029513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2606.07015","last_updated":"2026-06-05T07:59:17Z","snapshot_observed_at":"2026-08-07T10:25:26.085858Z","submitted_at":"2026-06-05T07:59:17Z","title":"Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:14:08.243894Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2606.07015"},"observation_digest":"sha256:d2022a945d4f7000f40b889e3ede537934a4d5dc1c08ea9cf031ae796db216b2","observation_id":"1d286042-38d6-46a9-87d2-4fdafd0c2d28","resolution":{"observed_at":"2026-07-02T19:57:19.589478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2606.25369","last_updated":"2026-06-24T03:57:21Z","snapshot_observed_at":"2026-08-05T15:29:17.177693Z","submitted_at":"2026-06-24T03:57:21Z","title":"Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T20:43:29.118351Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2606.25369"},"observation_digest":"sha256:f80608ea398f617c07d0bae79faac45d30c05ebd04bc11d9bd1269b2848f39f3","observation_id":"915faf9c-9a63-43c0-b69b-899a9e0a3c3b","resolution":{"observed_at":"2026-07-04T20:10:07.240619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2607.01702","last_updated":"2026-07-02T04:51:27Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:51:27Z","title":"Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-03T11:34:50.959335Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2607.01702"},"observation_digest":"sha256:fb74be265f6e00d764e65bd7c3b6ac592e97ad8cf169f641ce70b1b9c75a03d2","observation_id":"1873aa41-be37-4671-9839-1675ce152f0b","resolution":{"observed_at":"2026-07-03T11:38:04.489786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2607.01729","last_updated":"2026-07-02T05:34:20Z","snapshot_observed_at":"2026-08-05T09:10:48.323755Z","submitted_at":"2026-07-02T05:34:20Z","title":"DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T14:14:15.384573Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2607.01729"},"observation_digest":"sha256:9dc3c009a82a3c8825cb225f16d4528614e1bc255de213aabb7da23387e332ad","observation_id":"9ab2deed-da03-494e-aeca-ea8ca106afef","resolution":{"observed_at":"2026-07-03T14:18:22.475395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-07-11T22:31:42.563915Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03985","last_updated":"2026-07-04T19:05:37Z","snapshot_observed_at":"2026-08-07T15:23:22.762808Z","submitted_at":"2026-07-04T19:05:37Z","title":"NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T22:31:42.563915Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2607.03985"},"observation_digest":"sha256:e1465b0cdaca9516f5d319e12592ef5ce86c5825b4e96098265d40aaf5bb77ca","observation_id":"876a18b8-983d-45ac-8849-d68f7812da0f","resolution":{"observed_at":"2026-07-11T22:31:42.563915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-01T17:45:43.822357Z","title":"arXiv preprint arXiv:2303.00332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-07T11:10:34.915152Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:43.822357Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:a198f7be150ba573e5f8b2f439b16d642dca4001714995b72963a30e9db27ec7","observation_id":"9842536f-f687-4b94-bc37-531637d17157","resolution":{"observed_at":"2026-08-01T17:45:43.822357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-04T16:29:28.771675Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking.arXiv preprint arXiv:2303.00332, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:28.771675Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:d438e4a9fe0f5d5cb8364a404bb9fa16311f3b1c51b7ab3331a54545ecdb9f5f","observation_id":"7087df11-3eec-4a77-8acc-9f06df93ee5e","resolution":{"observed_at":"2026-08-04T16:29:28.771675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-07T00:14:48.305543Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking.arXiv preprint arXiv:2303.00332, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:48.305543Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:22b52318bd172d06bc821707fe76215befab3d8967048065a194bb7c1a88e238","observation_id":"dde9d30c-28e3-48db-bfa2-a2f7981db857","resolution":{"observed_at":"2026-08-07T00:14:48.305543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00332/citation-record","integrity":"/paper/2303.00332/integrity","json":"/paper/2303.00332/citation-record.json","paper":"/paper/2303.00332"},"outbound":[],"paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2303.00332."}