{"as_of":"2026-08-09T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86056dcafc67bad9fa38fbc9592c76afde3688369912d5e205a2cb430fda15dd","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T20:10:31.150625Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04314/citation-record","integrity":"/paper/2607.04314/integrity","json":"/paper/2607.04314/citation-record.json","paper":"/paper/2607.04314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"ASVspoof 2021: Towards spoofed and deepfake speech detection in the wild,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:f0bf370481686268a67de00d4c8c60be8235d63aae8d3c9fbb0f87a5410d6b2e","observation_id":"d1671982-0e41-4708-9c42-ee79fef06a12","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"ASVspoof 5: Crowdsourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:e0b5e79f74f265c93d4b2be08a5c0c5e579735b80a4fb7514be88ea73ac9616f","observation_id":"338d1d36-6e05-4454-9fbe-7d8361d3d096","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:e69f730a269a5d05999bc9e5a407bd670e69275dbdefa1e464b9f8b98a590403","observation_id":"66934558-3e34-4119-97f8-dcf13094b027","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:b0c08d89c7ab6da2975b380f99a3b3c9c8d659025ae15d0f704305cf8f0d4bd0","observation_id":"17ec56ad-fa4e-4206-ad33-cd2d60c91cba","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"AASIST: Audio anti-spoofing using integrated spectro- temporal graph attention networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:3bcefb56a64fce4797cf7d63ce472b544fe4a125554adb27936ff856fc0a0c33","observation_id":"73b03c90-d1f2-4487-a431-7d5fec2af6dd","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"End-to-end anti-spoofing with RawNet2,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:dc3466c5b41f225dbfe61ebd4ae106d8a518b8097b2e609e31bedc3705616dd1","observation_id":"3ec2cbbc-704f-45f0-976d-2f682efd0398","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Attentive merging of hidden embeddings from pre-trained speech model for anti-spoofing detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:f9bdee88ae63ae8766959f5f5d7d724a7249cf16be6ddc9363c7bad8790fc427","observation_id":"ddc466e6-d6e1-4303-9a19-1961f4cd210c","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Audio deepfake detection with self- supervised XLS-R and SLS classifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:82281dc658e996065fc24be1d4df8f59992c8ccfc5f9c726ff6837159dfbb875","observation_id":"b6ebf520-8efa-48b4-b7dd-528053a32f29","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Two views, one truth: Spectral and self-supervised features fusion for robust speech deepfake detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:c2a5c232e9bd4c1dacbd8bc9215cc1e9539a6071fb77b68535a7b60fa8539c3d","observation_id":"421bbb64-dbf0-47b4-93ce-f22483319b06","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14726","last_updated":"2025-02-20T16:52:55Z","snapshot_observed_at":"2026-08-07T18:01:26.635694Z","submitted_at":"2025-02-20T16:52:55Z","title":"Pitch Imperfect: Detecting Audio Deepfakes Through Acoustic Prosodic Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14726","snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Pitch imperfect: Detecting audio deepfakes through acoustic prosodic analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"cited_paper":"/paper/2502.14726","citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:1aa4c422ba47813f5c87f4800e45dc277dbe57bedab1c29e174937634b0c3f81","observation_id":"1de197a8-1a37-41a6-8e91-a5d50ce7620b","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Contributions of jitter and shimmer in the voice for fake audio detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:f112deee5d7c49f76f303d05658b6de239ef2ec4b8131f74817eedb0a328bc25","observation_id":"d712b68c-2111-4f27-ba96-d047513e3d84","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Toward robust replay attack detection in automatic speaker verification: A study of spectrum estima- tion and channel magnitude response modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:008c0622e1200ff5db9a758623fcb45c47f0822f37d68fc4883348e79df0d2ba","observation_id":"b143e5fc-1669-4f94-b823-a0496130599c","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Domain-adversarial training of neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:542d7a1607cc00a665c46eb060a2de5805f8e78ed963eed00409efd8915f40ef","observation_id":"e4933feb-17b9-4a24-a782-8793f9a7e2a0","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T20:10:31.150625Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T20:10:31.150625Z"},"links":{"citing_paper":"/paper/2607.04314"},"observation_digest":"sha256:b2e55613991f5ca45b2e73aa408a1a60a38651566c85a27985f04e9be005f9b2","observation_id":"95bb5885-f758-479f-87ff-b551ff83833d","resolution":{"observed_at":"2026-07-11T20:10:31.150625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04314","last_updated":"2026-07-05T14:02:09Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-11T20:10:30.977472Z","submitted_at":"2026-07-05T14:02:09Z","title":"MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2607.04314."}