{"as_of":"2026-08-09T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5791d9cc2cb00258c0351287412ddda318c00dc1bd4b50ebf2c9bb1de516a305","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:04.029122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:29:44.199281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:43:04.029122Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.029122Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:ca89272310b890d09b103be16f3c2c4ab87cf94b070d894a464a179f396580c2","observation_id":"5ad194ca-b72e-4f4d-9468-e213687d7f26","resolution":{"observed_at":"2026-08-07T15:43:04.029122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:04:50.995609Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16387","last_updated":"2025-05-22T08:39:48Z","snapshot_observed_at":"2026-08-07T14:59:45.104814Z","submitted_at":"2025-05-22T08:39:48Z","title":"Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:50.995609Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.16387"},"observation_digest":"sha256:451bd99db8bb3fed1abc96c13f2bfd4112189da1943d7dcc22b60e885741f5e5","observation_id":"c2722b4e-f906-42c7-a0ce-6e054e013cac","resolution":{"observed_at":"2026-08-07T15:04:50.995609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T13:32:32.813536Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21445","last_updated":"2025-05-27T17:16:59Z","snapshot_observed_at":"2026-08-07T13:25:17.303544Z","submitted_at":"2025-05-27T17:16:59Z","title":"VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:32.813536Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.21445"},"observation_digest":"sha256:8b0346090a890e37acb2d329e77b690fac20c070875cbc836c70e22eb8c51307","observation_id":"05674538-aa95-487b-adc8-d195f47d14ff","resolution":{"observed_at":"2026-08-07T13:32:32.813536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2604.22821","last_updated":"2026-04-28T17:29:55Z","snapshot_observed_at":"2026-08-03T17:25:43.148411Z","submitted_at":"2026-04-17T16:41:25Z","title":"Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T07:32:06.306966Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2604.22821"},"observation_digest":"sha256:97894e76e7acaa8499f2b2f1e19edf6c31488d4427db868bc6a61a834b4a7362","observation_id":"60f6bdce-a975-4e39-94d4-1a574ca3b838","resolution":{"observed_at":"2026-05-10T07:47:13.060741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2606.02400","last_updated":"2026-06-02T17:20:11Z","snapshot_observed_at":"2026-08-04T13:42:09.326463Z","submitted_at":"2026-06-01T15:47:01Z","title":"SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T12:37:52.271987Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2606.02400"},"observation_digest":"sha256:89c32659710aceed84a8faa3a42fa0c39195c85cae9908ad0bfba818c5fe2e06","observation_id":"37562708-62ef-40ff-a7c4-569a13b094c1","resolution":{"observed_at":"2026-07-02T01:06:24.520029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":"2306.15354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-07-04T09:29:44.199281Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement","venue":null,"work_id":"ed057aff-bb34-4947-bdc9-c310868b0a1d","year":2023},"citing_paper":{"arxiv_id":"2606.22369","last_updated":"2026-06-21T07:39:07Z","snapshot_observed_at":"2026-08-06T16:19:09.540031Z","submitted_at":"2026-06-21T07:39:07Z","title":"Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T09:52:58.661879Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2606.22369"},"observation_digest":"sha256:5481519b7c370a0ca2a5c1f336604369681d8c7d68702392a23a50c163320533","observation_id":"a2b513cf-b347-4a4f-8746-82d1435e9877","resolution":{"observed_at":"2026-07-04T09:29:44.201695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-01T11:33:14.026639Z","title":"3D-Speaker: A Large-Scale Multi- Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.026639Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:76d82c22e0315c4192536b6b8d0c639baadd21b630fc10ffa3ac8dd7d2399c16","observation_id":"505248d2-3a49-4223-b368-65e25321864d","resolution":{"observed_at":"2026-08-01T11:33:14.026639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.15354/citation-record","integrity":"/paper/2306.15354/integrity","json":"/paper/2306.15354/citation-record.json","paper":"/paper/2306.15354"},"outbound":[],"paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2306.15354."}