{"as_of":"2026-08-09T18:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eda3236261a7c8916381ff3ea24b0218a01e9f7fa27da4097b78963e0ed547c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:56:46.230938Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:39.522452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-06T22:56:46.230938Z","title":"Scaling up masked audio encoder learning for general audio classifi- cation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-08T07:26:02.720545Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.230938Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:632eee2f65a3af0c5392fe7375611cc436fa3267dbe53afc67c3509b4cbdf63d","observation_id":"b46a13a5-5276-415c-a05e-6a163b4ef094","resolution":{"observed_at":"2026-08-06T22:56:46.230938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-04T13:51:44.825761Z","title":"Scaling up masked audio encoder learning for general audio classification.arXiv:2406.06992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24901","last_updated":"2026-05-29T15:48:51Z","snapshot_observed_at":"2026-08-08T22:12:22.182176Z","submitted_at":"2025-09-29T15:11:18Z","title":"Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:44.825761Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2509.24901"},"observation_digest":"sha256:50eb9d1966c75ef76db3fc38135b7736ff7beede3b1d5cf8b726b0c9ee4c5122","observation_id":"491785a8-3459-4e14-8b06-35b25e30ec36","resolution":{"observed_at":"2026-08-04T13:51:44.825761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":"2406.06992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-07-04T07:39:39.522452Z","title":"Available: https://arxiv.org/abs/2406.06992","venue":null,"work_id":"242887a0-7c46-4728-a65b-8627575db050","year":2024},"citing_paper":{"arxiv_id":"2606.21365","last_updated":"2026-06-19T12:14:17Z","snapshot_observed_at":"2026-08-03T12:18:50.788553Z","submitted_at":"2026-06-19T12:14:17Z","title":"LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T12:58:27.702138Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2606.21365"},"observation_digest":"sha256:165b8e8e91373acc266124662fed872368c1bcf8be6e06de8003d8f99a89e65d","observation_id":"7c5a6f8e-1d76-45a2-9fad-a1df8ca714bc","resolution":{"observed_at":"2026-07-04T07:39:39.523962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":"2406.06992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-07-04T07:39:39.522452Z","title":"Available: https://arxiv.org/abs/2406.06992","venue":null,"work_id":"242887a0-7c46-4728-a65b-8627575db050","year":2024},"citing_paper":{"arxiv_id":"2606.30682","last_updated":"2026-06-27T03:56:57Z","snapshot_observed_at":"2026-07-07T00:04:29.879877Z","submitted_at":"2026-06-27T03:56:57Z","title":"ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T06:47:53.308909Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2606.30682"},"observation_digest":"sha256:4234ad87f98dd1d2a1020fc104ec744fdec1f962f62d0377c3f1dc2fb0f83587","observation_id":"93d0354b-deee-47d8-9f72-a4a6b1d755e0","resolution":{"observed_at":"2026-07-01T09:05:37.228821Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":"2406.06992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-07-04T07:39:39.522452Z","title":"Available: https://arxiv.org/abs/2406.06992","venue":null,"work_id":"242887a0-7c46-4728-a65b-8627575db050","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:3dd5af860bd395f68043e1dddfc48c08ff079ada0cebc2018e91f4b7d498cdb4","observation_id":"faddfb2d-605d-493d-8f29-330f43649b6b","resolution":{"observed_at":"2026-07-01T11:45:47.112058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":"2406.06992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-07-04T07:39:39.522452Z","title":"Available: https://arxiv.org/abs/2406.06992","venue":null,"work_id":"242887a0-7c46-4728-a65b-8627575db050","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:bc0ea484a87d04050b5afc3d8a3c9f5b0a36906e2d4acee0fde0fa107e7bb58c","observation_id":"fe046f72-72e3-4569-a496-4df20a5c0450","resolution":{"observed_at":"2026-07-02T05:56:39.845086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-02T01:12:30.683133Z","title":"Scaling up masked audio encoder learning for general audio classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-08T00:38:13.414993Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:30.683133Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:7b78fc22bf48ff961ccf69424ba706f2c49d294039dcbf2792e9b886296b0e26","observation_id":"3b53fdf3-0866-4d73-9c63-9cb55f6c3304","resolution":{"observed_at":"2026-08-02T01:12:30.683133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06992","snapshot_observed_at":"2026-08-01T14:46:35.218459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18666","last_updated":"2026-07-21T03:25:34Z","snapshot_observed_at":"2026-08-06T07:56:47.796949Z","submitted_at":"2026-07-21T03:25:34Z","title":"Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T14:46:35.218459Z"},"links":{"cited_paper":"/paper/2406.06992","citing_paper":"/paper/2607.18666"},"observation_digest":"sha256:1c8746a5f1300438cb4e05ae3d1cca1ca47aed909c7ed2e5fbf34db9dbfa9b72","observation_id":"c46ce0a0-409c-4b8c-bad2-cd897e7b0403","resolution":{"observed_at":"2026-08-01T14:46:35.218459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.06992/citation-record","integrity":"/paper/2406.06992/integrity","json":"/paper/2406.06992/citation-record.json","paper":"/paper/2406.06992"},"outbound":[],"paper":{"arxiv_id":"2406.06992","last_updated":"2024-06-13T04:38:02Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T14:31:19.128178Z","submitted_at":"2024-06-11T06:44:54Z","title":"Scaling up masked audio encoder learning for general audio classification"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2406.06992."}