{"as_of":"2026-08-08T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31b4c2731331605ea0ca26d744ffd9b6a9d127cb44828b1945d3d156033a77c8","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:29:54.084398Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02258/citation-record","integrity":"/paper/2506.02258/integrity","json":"/paper/2506.02258/citation-record.json","paper":"/paper/2506.02258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.212211Z","title":"Speech emotion recognition based on hmm and svm,","venue":null,"work_id":"e4d0843e-ead4-451c-b3b8-7612b8ee179a","year":2005},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.141074Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:cb04fa15f7cf86914c61df36693ecf53b6a5ae71afb6b496008cfa6f70ebe4a2","observation_id":"fc71a14e-b9b5-4e86-b62e-1eccbc0621ee","resolution":{"observed_at":"2026-08-07T11:29:55.216794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.197939Z","title":"Emotion recognition in speech using mfcc and wavelet features,","venue":null,"work_id":"cb2b8d7f-3080-452f-8c2b-dba178b86e6a","year":2013},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.180343Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:25bf4621ef8217f7e3d1d773d3f83d5b330680a83c463307e67f07a628c8c13d","observation_id":"c9b6b090-75e2-4ef8-97e9-15441a19ba65","resolution":{"observed_at":"2026-08-07T11:29:55.203011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.185279Z","title":"Speech emotion recognition based on feature selection and extreme learning machine decision tree,","venue":null,"work_id":"4452ae96-f8bb-4486-92fb-c3aa61b4b3b6","year":2018},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.236085Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:632d02c216501748194b689c80d5299378654c580491da61c71e5527e0762160","observation_id":"1b912b5f-c264-4fae-b6e5-828260b43db7","resolution":{"observed_at":"2026-08-07T11:29:55.190003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.167624Z","title":"Speech emotion recognition with dual-sequence lstm architecture,","venue":null,"work_id":"6a7d3396-fc3b-4089-9447-2a9a5888eabd","year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.283010Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b90ca17f141a79ef1340e8fd273ed996ecd6beb09a5d3431367003bec54a8082","observation_id":"05cb934a-48bf-4892-b403-97ca842b7208","resolution":{"observed_at":"2026-08-07T11:29:55.173025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.153663Z","title":"Convolution neural network based automatic speech emotion recognition using mel-frequency cepstrum coefficients,","venue":null,"work_id":"855213ca-1211-468d-ac03-571a3d708d10","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.344930Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:2c6525d9461c1776b63450e07e37406fe4dc384b20dae604ee35d8db3b4a616c","observation_id":"1f062ee6-db11-4b59-8db9-c7498806e1c2","resolution":{"observed_at":"2026-08-07T11:29:55.158322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.142701Z","title":"Ctnet: Conversational transformer network for emotion recognition,","venue":null,"work_id":"763b9304-a98b-4917-a1c6-dab2b44a67cf","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.398994Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:c62bfb61fab003632ba063a92af1b8e07362c7b5dd6153f09a5b495c4324f5ae","observation_id":"8b4d47a9-4339-41fe-9960-235e3d22a499","resolution":{"observed_at":"2026-08-07T11:29:55.146277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03502","last_updated":"2021-04-08T04:31:58Z","snapshot_observed_at":"2026-07-06T10:57:30.968546Z","submitted_at":"2021-04-08T04:31:58Z","title":"Emotion Recognition from Speech Using Wav2vec 2.0 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03502","snapshot_observed_at":"2026-08-07T11:29:52.459509Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.459509Z"},"links":{"cited_paper":"/paper/2104.03502","citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:745196c30531acd166f467f469ee87081d7b985ba83343c797b783a27a5454a8","observation_id":"f15749ac-0c24-496d-aae4-a5f7766a748f","resolution":{"observed_at":"2026-08-07T11:29:52.459509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18640","last_updated":"2023-05-29T22:27:48Z","snapshot_observed_at":"2026-07-06T15:35:07.850568Z","submitted_at":"2023-05-29T22:27:48Z","title":"Transforming the Embeddings: A Lightweight Technique for Speech Emotion Recognition Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18640","snapshot_observed_at":"2026-08-07T11:29:52.540223Z","title":"Transforming the embeddings: A lightweight technique for speech emotion recognition tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.540223Z"},"links":{"cited_paper":"/paper/2305.18640","citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b51cc0bf84d098e208a28cc9603a21315ff0215dd1dab034a89ac48fc65348fd","observation_id":"1228f4ed-326d-4082-b7cf-063425fb9bbd","resolution":{"observed_at":"2026-08-07T11:29:52.540223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.130769Z","title":"Adapting wavlm for speech emotion recognition,","venue":null,"work_id":"b86f7770-8cd2-4c9f-b863-825fc3aa590f","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.604361Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b97d370585e26b0eaa223614caa50d60a3ccc4676fd37de37241cc050336d033","observation_id":"c2055c74-ac05-47b6-b767-cc3b7bec6d69","resolution":{"observed_at":"2026-08-07T11:29:55.135147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.054751Z","title":"Audio mamba: Selective state spaces for self-supervised audio representations,","venue":null,"work_id":"d182c6ce-7bc7-49b7-9a67-16e986e53f1f","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.691205Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:965eb2cf75d74ed5f4ed2fab3ecb41d5345578df6a79de1180fa55b1e19282a5","observation_id":"dcf272e4-ab17-47b4-bd5d-66874f4c8801","resolution":{"observed_at":"2026-08-07T11:29:55.104324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.885914Z","title":"Speech emotion recognition considering nonverbal vocalization in affective conver- sations,","venue":null,"work_id":"8d380378-89e4-42af-93d8-2a0f3f402e80","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.700086Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:0bd4d36838ac1ae53ad4fa38c1cdb93489b1e983d017b81e365e995dc41c9de8","observation_id":"a954a949-eb11-4c71-91e0-39eab3549663","resolution":{"observed_at":"2026-08-07T11:29:54.977226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:52.780585Z","title":"Jvnv: A corpus of japanese emotional speech with verbal content and nonverbal expressions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.780585Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:ff03627913bdf4c364358ddce5f7ac76cee2df130e9bb403a0c2cc08ac914dbe","observation_id":"3d6631ce-bc9b-4570-868c-032edd60a33a","resolution":{"observed_at":"2026-08-07T11:29:52.780585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.714071Z","title":"Large-scale nonverbal vocalization detection using transformers,","venue":null,"work_id":"82306350-4e9f-42cb-8319-ef4be78c24e4","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.917984Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:c1917d94cac1db3e5f50b307e4657728a408694cdc67d945243aeef62d6587dc","observation_id":"16b4b1d8-020d-4e38-8091-32195789b2fc","resolution":{"observed_at":"2026-08-07T11:29:54.797553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.597224Z","title":"Investigation of ensemble of self-supervised models for speech emotion recognition,","venue":null,"work_id":"6779b2c0-5fab-448c-9841-e39ebfc0d51e","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.110719Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:86c4d52b243c02f7ed159b95a025c26f1ff743c91c0c184d1eb0a5c010e67af4","observation_id":"f3947231-5db5-4fc1-a000-36366dc4d0f7","resolution":{"observed_at":"2026-08-07T11:29:54.641425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.529194Z","title":"Heterogeneity over homogeneity: Investigating multilingual speech pre-trained models for detecting audio deepfake,","venue":null,"work_id":"5d259c1a-e84d-4d84-b6c0-7dbc3c7655f9","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.269332Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:537db77f905562b46a8d6f990a2487e4260591dd0abdd40db9c80e5820528c1b","observation_id":"ca4873d6-0c0d-4e6b-a43a-e65f13184559","resolution":{"observed_at":"2026-08-07T11:29:54.588877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.455978Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.455978Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b7c45890dd1a13e836fa06b742c745cf41306c9b77e618b77a53933b27da4bf0","observation_id":"acfaa700-c80b-48a7-8cf7-14352455a022","resolution":{"observed_at":"2026-08-07T11:29:53.455978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.390585Z","title":"Unispeech-sat: Universal speech representation learning with speaker aware pre-training,","venue":null,"work_id":"aaafd5bc-fbca-466e-970d-991cb0ff35ee","year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.619048Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:4f505160e833f831f9bbbc4385e2693af116be3977ae15d7769b3458801cd9d6","observation_id":"cb1e393d-8591-4161-be9a-ea9244a82828","resolution":{"observed_at":"2026-08-07T11:29:54.455841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.770157Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.770157Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b295508b2ceb85ad1b67954cf2a74ca5f375ecd9e6dfa7bf076315b8f9aeef26","observation_id":"f5cf2178-ceb3-4c9e-9b77-b447c2c7174a","resolution":{"observed_at":"2026-08-07T11:29:53.770157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.913426Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.913426Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:a7bad4bfef910a9e872abc4945ea139494a572beb87315cbb8c0ab81573d6512","observation_id":"a3d5bfc7-3246-4ca6-9c49-d8b336f159fc","resolution":{"observed_at":"2026-08-07T11:29:53.913426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.057247Z","title":"R ´enyi divergence and kullback-leibler divergence,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.057247Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:542f67e0d5ae405efb2f993a36211b1b38486fc05c07e6f454dbb6983228636d","observation_id":"36458d9a-1854-4b5c-8ab7-553d023f5c4e","resolution":{"observed_at":"2026-08-07T11:29:54.057247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.077393Z","title":"Asvp-esd: A dataset and its benchmark for emotion recognition using both speech and non-speech utterances,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.077393Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b7102ef330fb54a4d0b78ce0929c9d72f1d672efc4bf75818d2232739446a0cb","observation_id":"5ff0ecd1-5f3b-40b7-9a2d-3b9b7d77c9a7","resolution":{"observed_at":"2026-08-07T11:29:54.077393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.243274Z","title":"Jnv corpus: A corpus of japanese nonverbal vocalizations with diverse phrases and emotions,","venue":null,"work_id":"2bbb9083-c00a-4c1f-91bc-a751c886344b","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.080965Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:8460bed3a4e34a9ba31339ef011cb4c7804d0811c5e7cc2147d2b64feb9ccb46","observation_id":"82c93a67-9c89-4e6a-995f-fb5e3a48f7f6","resolution":{"observed_at":"2026-08-07T11:29:54.319362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.129708Z","title":"The variably intense vocalizations of affect and emotion (vivae) corpus prompts new per- spective on nonspeech perception","venue":null,"work_id":"784c21f0-4b60-40ca-8a04-9e975e287a7c","year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.084398Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:1c8ca39c3344e137a00d3822b05f46cacaf030f8d99ad94714982ddf92b8fdd3","observation_id":"1b27c255-fff4-428e-a2a8-86c7ea9f4a45","resolution":{"observed_at":"2026-08-07T11:29:54.187393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.02258."}