{"as_of":"2026-08-14T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c098dfd6b14bc6a2b7b86d3227a174b3143133e6b454d7541ff9121f69f1eba3","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:38:01.992997Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05558/citation-record","integrity":"/paper/2412.05558/integrity","json":"/paper/2412.05558/citation-record.json","paper":"/paper/2412.05558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.791864Z","title":"Pattern recognition, 44(3):572–587 (2011)","venue":null,"work_id":"1390f490-a3af-433e-9add-33fa9ce7a3bd","year":2011},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.808303Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:00fe447979887aeef38148a16454399ff7481f96e91b2fd58697c38b855ee996","observation_id":"4b7eceb0-f550-487e-a270-1ebc06d8669b","resolution":{"observed_at":"2026-08-11T20:38:02.798188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.775174Z","title":"In 2021 7th International Conference on Computer and Communications (ICCC), pages 514–518 (2021)","venue":null,"work_id":"47e18983-4899-4281-a234-ecb22ae93ef1","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.824900Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:050a93f9a469e032f0eb45201be384ae942feacb24b98febd19b8ebc33fc131e","observation_id":"75c1d878-9e3e-4efc-b926-49b24acc88c6","resolution":{"observed_at":"2026-08-11T20:38:02.779794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.755236Z","title":"In Third international conference on natural computation (ICNC 2007), volume 5, pages 809–813 (2007)","venue":null,"work_id":"acac9ace-73b0-4400-a0c6-ed165e1594dc","year":2007},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.830165Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:95e911bfa3422ee7a22a5cdf2242d514240fcb7e8a4348d875275a803fc7b8fa","observation_id":"891e4fb8-ae2d-4add-a0a3-bc01825ea43a","resolution":{"observed_at":"2026-08-11T20:38:02.764821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.725104Z","title":"In 2022 IEEE 8th World Forum on Internet of Things (WF-IoT), pages 1–6 (2022)","venue":null,"work_id":"8ff01871-8c4f-4786-b50f-39c786878156","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.840892Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:00896cd78e94810cbcf59319786853828a1f80e44e1c9033a4ba5981208a1c17","observation_id":"90355c7f-f9aa-42e6-97bf-fb0fcd779427","resolution":{"observed_at":"2026-08-11T20:38:02.731202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.700634Z","title":"In Applied Information Processing Systems: Proceedings of ICCET 2021, pages 83–92","venue":null,"work_id":"8b4c03ac-bed9-4fef-a7b7-d9211b36e7fe","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.846676Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:9b1fb0bdb24190352cff26db84fa8fe1f3d62bc0362fa84f2fd685ff71bc2a36","observation_id":"8f0d4748-a828-46ff-a306-34bb81aa4fdb","resolution":{"observed_at":"2026-08-11T20:38:02.711651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.679645Z","title":"In 2017 seventh international conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW), pages 79–80 (2017)","venue":null,"work_id":"da905929-273f-417e-8a06-deedb3cf9210","year":2017},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.852707Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:010f94199818efd7bed05694ee530d330cc02be32bc0802ab3ab28b7a42accb8","observation_id":"4258f317-d558-40b5-8bf0-51206ae62049","resolution":{"observed_at":"2026-08-11T20:38:02.685887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.652083Z","title":"In Proceedings of the AAAI conference on artificial intelligence, volume 30 (2016)","venue":null,"work_id":"432ab1fc-0dfd-43b4-af40-80b548c2e5d6","year":2016},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.859494Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:5e1a0d0c3841c2fb9b498935d6edce37e7fa9a6f082c1e0214c77474ba37d32a","observation_id":"c81c9578-815a-42b1-a169-c0e68cb2537d","resolution":{"observed_at":"2026-08-11T20:38:02.657784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.631618Z","title":"Multimodal emotion recognitionusingdeeplearning","venue":null,"work_id":"ec3c79ef-8895-4a9a-9614-5111e7a80f42","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.866378Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:baa3f81e731ae5dc1a7a036c643be48a284d96780654e1bb6a584b5c1dcee751","observation_id":"d22bed2b-83f6-4328-9592-841e4a64bdae","resolution":{"observed_at":"2026-08-11T20:38:02.636722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.611007Z","title":"In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6269– 6273 (2021)","venue":null,"work_id":"af200085-be93-4f9c-bbbe-4d9323360bf7","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.872690Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:6cabfd39c580b611a273d2d41a2935a5ca69f45992283f91817ac1183745fbf2","observation_id":"11d941ef-eedb-499e-b5e7-c41d451b3a85","resolution":{"observed_at":"2026-08-11T20:38:02.619088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.577761Z","title":"In AVSP 2001-International Conference on Auditory-Visual Speech Processing (2001)","venue":null,"work_id":"ede9a361-2e2d-4597-8e96-1b4a6c9c734a","year":2001},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.880060Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:85be837c5827183c6238478b27d5a3dde4cdfc29e30653f6b9717995bba118d1","observation_id":"e592e0b5-83b1-4628-a472-b0c67f6711fb","resolution":{"observed_at":"2026-08-11T20:38:02.583663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.553082Z","title":"In Proceedings of the conference","venue":null,"work_id":"ee33e8e8-d34f-492a-a94a-5f9d040cc3f3","year":2019},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.888215Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:fba528f68488fa7e30d8b85724acd2d0f8800500d66106d8552d13de4e3fdc58","observation_id":"93ff3b66-8bd4-479b-a77d-f3712b9c5ae7","resolution":{"observed_at":"2026-08-11T20:38:02.567658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.519137Z","title":"IEEE Transactions on Multimedia (2022)","venue":null,"work_id":"c15757b7-d33c-49d2-bc36-7967543db772","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.894927Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:5840b982eabf6ddd4046b51991e80283fd3611ba1d771631112c9d149ba27b5c","observation_id":"9b0bb16a-6534-4836-848a-bc5d017117c6","resolution":{"observed_at":"2026-08-11T20:38:02.528916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.485820Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3592–3603 (2021)","venue":null,"work_id":"d1ff2dce-fa62-4d04-8071-d97a16518c26","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.900223Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:396484c539b70cbcbd274853a7ae512acabefdc02a45529669493fe3267f2589","observation_id":"139cbc43-57bf-432a-bfbd-a019b089ad22","resolution":{"observed_at":"2026-08-11T20:38:02.495930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.456575Z","title":"In Proceedings of the 28th ACM international conference on multimedia, pages 1122–1131 (2020)","venue":null,"work_id":"54f9ecad-1de9-4993-a450-b5573645623b","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.907033Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:f4174232f0ab5a60e5c373beceb8f5af4536e28ff92572f3258344ddb958122f","observation_id":"027aeed2-1e83-4d08-9ca8-778caace0dc1","resolution":{"observed_at":"2026-08-11T20:38:02.467416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07637","last_updated":"2020-10-15T10:10:41Z","snapshot_observed_at":"2026-08-13T00:00:30.906973Z","submitted_at":"2020-10-15T10:10:41Z","title":"DialogueTRM: Exploring the Intra- and Inter-Modal Emotional Behaviors in the Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07637","snapshot_observed_at":"2026-08-11T20:38:01.914107Z","title":"arXiv preprint arXiv:2010.07637 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.914107Z"},"links":{"cited_paper":"/paper/2010.07637","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:6fc7619196cab85d23318bd3d15432cdb9244107c1010d6bcb7a47fb2a120449","observation_id":"9c108565-c1c1-4f0c-9044-b4c0cd9116f3","resolution":{"observed_at":"2026-08-11T20:38:01.914107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06779","last_updated":"2021-07-14T15:37:02Z","snapshot_observed_at":"2026-07-06T11:29:07.489964Z","submitted_at":"2021-07-14T15:37:02Z","title":"MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06779","snapshot_observed_at":"2026-08-11T20:38:01.920850Z","title":"arXiv preprint arXiv:2107.06779 (2021) 12 F","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.920850Z"},"links":{"cited_paper":"/paper/2107.06779","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:ab58fb00913227686ab596f8e4cd9f718fa3e68c7c205bc641fc2c18b45bbb9a","observation_id":"2d01b38e-ec0a-413d-ab04-70287b931bbf","resolution":{"observed_at":"2026-08-11T20:38:01.920850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.427301Z","title":"In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 7037– 7041 (2022)","venue":null,"work_id":"118f28fc-5e6f-49ab-a434-c0553bdb4691","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.929176Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:ad4a3764fe52130ed8eb75ad459f6323f67993f74a627941731cd4ac39be4d76","observation_id":"1231d2dc-80e6-4105-a184-1b9cce8eaa8e","resolution":{"observed_at":"2026-08-11T20:38:02.432840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.407735Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 4652–4661 (2022)","venue":null,"work_id":"1221dbf4-08a2-495b-8a82-a3a77b6da37b","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.935087Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:65e98f8ff73064b3b304a9ddab351d857ce423e84c9f5d257cce775a85c96589","observation_id":"f5f342c8-ee45-411c-b7e5-b6e75c0a8ebc","resolution":{"observed_at":"2026-08-11T20:38:02.413287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.370930Z","title":"Advances in neural information processing systems, 33:12449–12460 (2020)","venue":null,"work_id":"d1a7f776-dd1f-4c11-a4a7-2052f977c7e4","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.941879Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:cfd1ee8c6b590efd7dce13edf43b64bfd897d9d2686d0b461cad0d1ac85d1d11","observation_id":"fc0c21ce-1eb2-46e7-9463-fa96279327bc","resolution":{"observed_at":"2026-08-11T20:38:02.380907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.331176Z","title":"Centralized feature pyramid for object detection","venue":null,"work_id":"414a0894-0699-4c37-90ab-d9046a14ad97","year":2023},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.946381Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:c5ef35769283c159e5366d47f3f9ebaa89d1920751b0757b644016dd8a33a595","observation_id":"5fd2a026-115f-43ff-b3f0-3017e4ab8058","resolution":{"observed_at":"2026-08-11T20:38:02.338648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.305054Z","title":"Language resources and evaluation, 42:335–359 (2008)","venue":null,"work_id":"4e989780-4e39-46f4-b9af-b6c6a631be2f","year":2008},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.951740Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:5351f9126c5e46c32e9ed13d39af36f03a3b70e783a7b884df0b986be30d1a01","observation_id":"21ac3475-0b06-40ac-b452-8d20b1e91306","resolution":{"observed_at":"2026-08-11T20:38:02.319049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-09T15:41:11.041317Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-11T20:38:01.958786Z","title":"arXiv preprint arXiv:1810.02508 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.958786Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:a26a3dbebc87ac161e41ab82da21cec71c857716f4ee5eafaf16018d18c0cc5b","observation_id":"807482db-a36f-4fea-bd0d-bbce639f42f7","resolution":{"observed_at":"2026-08-11T20:38:01.958786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.281221Z","title":"In Proceedings of the 28th International Conference on Computational Linguistics, pages 4190–4200 (2020)","venue":null,"work_id":"dd8acbc6-a44f-46f8-a02c-48341f61e127","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.965587Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:6f97943f998921473ee7d241e3f3c324e04e4aa76ad7a4079372a24ae4718fed","observation_id":"5ec6c1a4-8b09-4d32-ab03-0300abee401d","resolution":{"observed_at":"2026-08-11T20:38:02.289001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.254384Z","title":"In Proceedings of the AAAI Conference on Artificial Intelligence, volume 35, pages 13789–13797 (2021)","venue":null,"work_id":"d594b5a7-962a-4b72-a767-48fb01075793","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.972177Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:43d59fabfe19b675b435b9e83dbd6e09d222882de46a0ab8fbb224fb47b19d7a","observation_id":"8754cb24-90ab-4a5e-9963-46622dff684b","resolution":{"observed_at":"2026-08-11T20:38:02.261810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02455","last_updated":"2022-05-05T05:54:24Z","snapshot_observed_at":"2026-08-13T15:49:48.655160Z","submitted_at":"2022-05-05T05:54:24Z","title":"COGMEN: COntextualized GNN based Multimodal Emotion recognitioN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02455","snapshot_observed_at":"2026-08-11T20:38:01.978552Z","title":"arXiv preprint arXiv:2205.02455 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.978552Z"},"links":{"cited_paper":"/paper/2205.02455","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:bb2b4031480d144beef6cb2a4c74f8e322894050859856d2cf0e083df0910f39","observation_id":"ce9f55e5-8624-468e-88f7-161c0aa4d89a","resolution":{"observed_at":"2026-08-11T20:38:01.978552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.204412Z","title":"Neural Computing and Applica- tions, pages 1–14 (2023)","venue":null,"work_id":"4355e6c3-759b-4f2a-b58e-e89f9417b1cc","year":2023},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.984168Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:485d823e7c87a5d3105d0c0d6ce030b3d4b715a45a11c627113e161139a4b9e0","observation_id":"b9b28c35-92b2-43d9-b28a-dd8b96bc7a1a","resolution":{"observed_at":"2026-08-11T20:38:02.228561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11256","last_updated":"2022-11-21T08:46:01Z","snapshot_observed_at":"2026-08-13T13:38:31.442891Z","submitted_at":"2022-11-21T08:46:01Z","title":"UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11256","snapshot_observed_at":"2026-08-11T20:38:01.992997Z","title":"arXiv preprint arXiv:2211.11256 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.992997Z"},"links":{"cited_paper":"/paper/2211.11256","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:2213e9eef4a22adf9b97586bb09b2ba68c0720f43c91e075d5753c841c623151","observation_id":"65dcd5cc-aecb-498f-8bf5-4a31b6e0ac83","resolution":{"observed_at":"2026-08-11T20:38:01.992997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2412.05558."}