{"as_of":"2026-08-08T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2201374f323265125b8fff154acda48fc8a41a495e27112321f3b771663dcec","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:43.208707Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00903/citation-record","integrity":"/paper/2506.00903/integrity","json":"/paper/2506.00903/citation-record.json","paper":"/paper/2506.00903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.485814Z","title":"A survey of state-of-the-art approaches for emotion recognition in text","venue":null,"work_id":"ce51d8e6-7c77-4d3b-a7ec-e3d64b22f6a6","year":2020},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:36.992164Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:0356b50325ddbfcbcea5dcce1bf4884e76453f13a116bfd0a03dc32c35ecc6ad","observation_id":"913ffe1a-f211-4c30-af5c-e927cb5bed4b","resolution":{"observed_at":"2026-08-07T11:58:55.579814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.261627Z","title":"Multimodal lan- guage analysis in the wild: CMU-MOSEI dataset and inter- pretable dynamic fusion graph","venue":null,"work_id":"5e55435e-e246-46e7-8ab5-2b338c2e80f6","year":2018},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.079396Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:33dde9d6d6c035cd309591e38ee169e478d7c98ee882032ab755125066647128","observation_id":"04dee490-1e60-42c1-a13c-2b93d050c45a","resolution":{"observed_at":"2026-08-07T11:58:55.339800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.023946Z","title":"Multimodal machine learning: A survey and tax- onomy","venue":null,"work_id":"5a3f7771-aa30-4102-8c5a-5a5fd923fdb6","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.209014Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:6d88be51ebfb90a82e9441aeca13f01b0dc0654a8869754f241b922e2e068fcb","observation_id":"cb2f650d-4705-42df-82f5-acd630d937c1","resolution":{"observed_at":"2026-08-07T11:58:55.111628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.743595Z","title":"Openface: An open source facial behavior analy- sis toolkit","venue":null,"work_id":"bc2d0f16-8fc2-4090-8edb-b04c4624fc39","year":2016},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.350776Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:25f5af1f3db942756cf471640632872fa661546e4264a657f0cedad46cb67754","observation_id":"725b42f8-3194-498b-a8be-df7e1ff62ba0","resolution":{"observed_at":"2026-08-07T11:58:54.867373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.532885Z","title":"Narayanan","venue":null,"work_id":"b80d7061-faf4-4d9f-8a5b-40351a97d9b9","year":2008},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.485921Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:7c8d7c67327bfd1695bea340bd388b82ac08099e335455a459ee745575abd895","observation_id":"2a8c76f5-a6b2-46f3-8f2c-5699eb9df6b1","resolution":{"observed_at":"2026-08-07T11:58:54.620722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.343753Z","title":"Finecliper: Multi-modal fine-grained clip for dynamic facial expression recognition with adapters","venue":null,"work_id":"88e63700-0258-4fab-b48d-5f491bd374f1","year":2024},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.573830Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:cb063708cbbda6a4633c6c72ebbd4d77cc59ce12a709daf2b9093af20788a1da","observation_id":"e0d19d05-500e-45c6-ad2b-aa5b037fce91","resolution":{"observed_at":"2026-08-07T11:58:54.456005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.023795Z","title":"Covarep: A collaborative voice analysis repository for speech technologies","venue":null,"work_id":"abc958a2-fab4-4b02-8c25-df30e536e708","year":2014},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.677902Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ebfee98e6a85243f55fbbe848bfeac64f450bc889d4ce63bb2ebaaf1af10bf9e","observation_id":"588d6738-779a-43ee-b67c-c0eb68d2bfc2","resolution":{"observed_at":"2026-08-07T11:58:54.196225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.794152Z","title":"Data determines distributional robustness in contrastive language image pre-training (CLIP)","venue":null,"work_id":"04ba569f-8e32-4b9d-b2a6-dc3b318c4b9f","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.803797Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:f0e35a34722386fc4d0099a2d0bf9f85820ddb788a39ad44855c5166bb0b0bd0","observation_id":"5b89e5de-fde1-4d06-8145-4ca440a0d685","resolution":{"observed_at":"2026-08-07T11:58:53.920451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.606738Z","title":"Emoclip: A vision-language method for zero-shot video facial expression recognition","venue":null,"work_id":"1b714355-a3fe-4a74-bd1c-c59597353045","year":2024},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.900242Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:b173f9c4961df71a78ed2e62cc0c1b2d86bbceb75720bc327311d48362cb8f9b","observation_id":"c09c4d1d-0654-41a6-befb-da3b952077e9","resolution":{"observed_at":"2026-08-07T11:58:53.685758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.351586Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":"7e60a1c1-aedc-455b-af90-0f1adf3e33d2","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:37.970173Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ad8abaf39781ee56d86d1c435dcf93ad4fb2e1c6d89cd1a4886b4ed9f625dad5","observation_id":"6dc821e6-76b2-4026-9523-8119e830f26b","resolution":{"observed_at":"2026-08-07T11:58:53.518184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.061008Z","title":"Esresne(x)t-fbsp: Learning robust time-frequency transformation of audio, 2021","venue":null,"work_id":"8d2ffe56-d45f-4cec-bd79-718fc60882d5","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.152192Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:7ebd14ba154fa8a04ca6c4eb7aff38ec8e68045524a2c82b268c4963a8dc1029","observation_id":"9e6b04ec-510e-470a-b56f-d88659f333f8","resolution":{"observed_at":"2026-08-07T11:58:53.247113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.780375Z","title":"Audioclip: Extending clip to image, text and au- dio","venue":null,"work_id":"c52b6850-78d5-443b-96fd-1c87c15d2f21","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.269976Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:e388c15442dc81986a92c23191ffa4f9cd16262663aa22895c6e1f73db7dc76e","observation_id":"d1df064c-6823-4790-912c-e0642933214f","resolution":{"observed_at":"2026-08-07T11:58:52.908148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.570724Z","title":"Misa: Modality-invariant and -specific representations for multimodal sentiment analysis","venue":null,"work_id":"d41e3f99-cd41-482d-aa87-e560e711b9e6","year":2020},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.402857Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:410e37d1e14a0e943138bc582fdf5824db0237a2015e8c1c5676fc5881cccd29","observation_id":"84caed99-495d-4b09-bcd0-730004d2f085","resolution":{"observed_at":"2026-08-07T11:58:52.684058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.378101Z","title":"Deep multi-task learn- ing to recognise subtle facial expressions of mental states","venue":null,"work_id":"8bb14a46-de67-4465-b531-de4cdafe25ef","year":2018},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.536098Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:7ed78e3d3ae2dbbdaa2547b138e3c5cf7e3c70ec64350d04b59ddd7f7673cb45","observation_id":"c5fc61c7-fa32-4458-8aae-b34888d590ab","resolution":{"observed_at":"2026-08-07T11:58:52.470990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.154507Z","title":null,"venue":null,"work_id":"69f4eaff-7684-4f08-aa1a-cb94cedd744a","year":2023},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.664993Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:4fac6125d09b53c0694cd141427bb0296e8a4514b2bdb5b03cc69d0f439ad226","observation_id":"dbea8fd7-ba72-46b7-a93c-a1a526f2a0cb","resolution":{"observed_at":"2026-08-07T11:58:52.286100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.963362Z","title":"Attention is not enough: Mitigating the distribution discrepancy in asynchronous multimodal sequence fusion","venue":null,"work_id":"a1819a54-02d7-4f79-ae1c-10ef2ff1976c","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.777293Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:da1dbb36b5965facf6a814372c52f1b5db3b8a2e0dcdb034bd89690d78ed4285","observation_id":"c8b24d84-ef50-4c66-882f-6552ae2e0a09","resolution":{"observed_at":"2026-08-07T11:58:52.056692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:38.895254Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:38.895254Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:7226cc0fca0635b06141300fb88645ba98d255dc733e91bfaca815e65d8af01b","observation_id":"cd1d26e9-3cf5-4d7c-847e-a407c6ee3032","resolution":{"observed_at":"2026-08-07T11:58:38.895254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.717352Z","title":"Progressive modality reinforcement for hu- man multimodal emotion recognition from unaligned multi- modal sequences","venue":null,"work_id":"645d6380-630e-4cce-a336-beee21fe6f01","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.037880Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:5d7f31c56cece03209d6eb0052aec7293aed1552e7862da68914cc169fbe0415","observation_id":"44bdd621-0451-497c-b7f2-6dfafc317213","resolution":{"observed_at":"2026-08-07T11:58:51.838240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.426023Z","title":"The Stanford CoreNLP natural language processing toolkit","venue":null,"work_id":"9e179f02-579b-480a-8684-203a367c6cf3","year":2014},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.145592Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:779c588e0b331753d9d38b07e6c4bef7a54d048e843274f4b9f939085fffb10f","observation_id":"8aa31651-cea6-402e-86ed-01a570660d34","resolution":{"observed_at":"2026-08-07T11:58:51.582091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.158473Z","title":"M3er: Multiplicative multi- modal emotion recognition using facial, textual, and speech cues","venue":null,"work_id":"2dccf0e6-2f73-4773-a212-8ad54236458c","year":2020},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.261470Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ba027b719c48c036f7638ec45c2873516d08e5b5541b5fa9f7b0718951759bbc","observation_id":"857fd497-e843-41bf-a4db-a024a7f02497","resolution":{"observed_at":"2026-08-07T11:58:51.277342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.890988Z","title":"Ma- hoor","venue":null,"work_id":"3d10581b-5ccf-41b8-9922-fb1f9dbb9dce","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.377863Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ffdcc23acaa9b33e16baded6edd4caf545a5692c65d193d06559a9a9cf42238e","observation_id":"ef198261-108d-436b-8010-f7645ee4e41e","resolution":{"observed_at":"2026-08-07T11:58:51.041927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.646770Z","title":null,"venue":null,"work_id":"183c825b-9f13-45be-a5e6-769b47001526","year":2011},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.513973Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ff345fbbd1de239676168c5db5b6ae80720cff74890032116a4fb22112ca8c83","observation_id":"a1aa5eb6-223d-478b-9755-8b8da34bb7ea","resolution":{"observed_at":"2026-08-07T11:58:50.749488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.464165Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"8ab89433-1cfd-4718-a8cc-272f39e8b904","year":2014},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.602591Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ce0a4dca0e10fb10ed515802ee4217938af40b7dd68676a13de1ea6faaf63d1b","observation_id":"7ccb7c58-ee45-4233-9188-b514ebe4a1fb","resolution":{"observed_at":"2026-08-07T11:58:50.550289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.230062Z","title":"Found in translation: learn- ing robust joint representations by cyclic translations be- tween modalities","venue":null,"work_id":"cd5baa40-1471-4275-a257-b583d04cf1f3","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.698272Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:e6bd28c65e48dca6b425e72a25bdb7f81007cab2e96179613cb94e9d4671dd58","observation_id":"678e6850-0043-4be8-aed8-1df42c66272e","resolution":{"observed_at":"2026-08-07T11:58:50.354952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.989437Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":"b0c9637e-cdd7-4e58-9a51-abaf372adbec","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.857845Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:8fe191a53c28430a2f1444a2daafc1ffffc47e2716a7448df224aef451478317","observation_id":"a253ac0e-e3c9-4743-9234-9ad32eacc4c9","resolution":{"observed_at":"2026-08-07T11:58:50.105153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.429417Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"49ceb548-2278-41d6-88f1-6cf100bc9848","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.099817Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:54808c3f48cf4f271ced4dcc9a649b155bde0b3b658baa391946a0b457e9e069","observation_id":"6de451b0-7f0e-4ee8-a5f2-bbc8c2ead762","resolution":{"observed_at":"2026-08-07T11:58:49.580704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.179040Z","title":"Fine-tuned clip models are efficient video learners","venue":null,"work_id":"42e7c59b-0662-43da-aac8-660e1d0382e0","year":2023},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.216660Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:eb67da72be73831b6dfb81f6f3ded331d83f0e7ae95dfda5b658ceea3ee1e6cd","observation_id":"3dbd69e5-5131-447a-b23a-44a33b9bee9d","resolution":{"observed_at":"2026-08-07T11:58:49.302570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.952063Z","title":"Accommodating audio modality in clip for multimodal processing","venue":null,"work_id":"c7165d96-be99-4392-b629-235416865ff9","year":2023},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.305682Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:bb2604f96d9fabf7772a383ed934c85b568b00669e15d1886e59ffde9ab8fd48","observation_id":"85e58ac6-61c4-4912-bcc2-38ce52928e72","resolution":{"observed_at":"2026-08-07T11:58:49.054639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T11:58:40.406313Z","title":"LAION- 400M: open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.406313Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:843bd810996997d426be47b7a4bb6336c3ffe625d583ad75ead4397ae915aca3","observation_id":"d193c81f-e17c-4225-9cc9-47453ffa297a","resolution":{"observed_at":"2026-08-07T11:58:40.406313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.669277Z","title":"Sheikh, Rupayan Chakraborty, and Sunil Kumar Kopparapu","venue":null,"work_id":"fca78345-bbff-4016-9a16-d2fcfba6e6b7","year":2018},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.519096Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:2d84833c8601fee11fbe423b5bf8b559e42376c93a270880c235635a8ea4ee0e","observation_id":"02fa32c0-2af0-4ba3-b118-eafcd6f16406","resolution":{"observed_at":"2026-08-07T11:58:48.809591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06176","last_updated":"2019-05-14T14:16:40Z","snapshot_observed_at":"2026-07-06T06:45:08.082087Z","submitted_at":"2018-06-16T03:48:50Z","title":"Learning Factorized Multimodal Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06176","snapshot_observed_at":"2026-08-07T11:58:40.613619Z","title":"Learning fac- torized multimodal representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.613619Z"},"links":{"cited_paper":"/paper/1806.06176","citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:773ad7af47c9139ea554575638fcc09974b9b8c7aaa4b44f16a4a2495e8e3556","observation_id":"e28770d1-9d25-4e3d-a5e7-78a91c58250d","resolution":{"observed_at":"2026-08-07T11:58:40.613619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.437442Z","title":"Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov","venue":null,"work_id":"5782bb61-557e-4bd5-b704-34ec4cb58d25","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.740192Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:5363ea9b6a400658fb445365963c0ff96dcfd142968234a2616e33945ea66d33","observation_id":"ae3658bf-d11c-48c9-90d6-c4241b1a6637","resolution":{"observed_at":"2026-08-07T11:58:48.556394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.989244Z","title":"Suppressing uncertainties for large-scale facial expres- sion recognition","venue":null,"work_id":"15ecec31-69c1-4b4d-9079-3ee386e4a502","year":2020},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.964911Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:645a93bf1c49ce22aed8574678c5569674347158d066384f792462a90a843567","observation_id":"878e9b75-0fdc-44e0-b7d8-64a1d62c6019","resolution":{"observed_at":"2026-08-07T11:58:48.107389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.751569Z","title":"A novel end-to-end speech emotion recognition network with stacked transformer lay- ers","venue":null,"work_id":"15a2085b-5ff7-4876-ae5c-b3cbba776393","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.093397Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:b1ddf8d84d23407110a9ec0249ec0f919e5f26816667944442e613948a338746","observation_id":"384ab5e6-038a-4eca-866e-fabbf20f0b97","resolution":{"observed_at":"2026-08-07T11:58:47.859062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.517308Z","title":"Words can shift: Dy- namically adjusting word representations using nonverbal behaviors","venue":null,"work_id":"5baf2f09-a2d6-43a8-8dd9-d4521fdddea4","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.200740Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:23e7af95d77787f25c65b737b5a4c24fb14fdcedb7b4a39c1bbcf02409e9d3a7","observation_id":"663d340d-2ba6-4d8b-b022-586b131c6b3a","resolution":{"observed_at":"2026-08-07T11:58:47.622625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.260170Z","title":"Wav2clip: Learning robust audio repre- sentations from clip","venue":null,"work_id":"d6777b07-166b-4555-adab-03adc2d53326","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.345797Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:272215563a2583c66f93852d1de77832be73da5f09015d8aafc6645f29667142","observation_id":"e9b77623-a8ab-450a-9d25-cdb6f242da6e","resolution":{"observed_at":"2026-08-07T11:58:47.380397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.010857Z","title":"Multi- view multi-label learning with view-specific information ex- traction","venue":null,"work_id":"7ed1694d-da8d-46c0-b168-fc7aff15b9b6","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.460363Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:fc6c3b3132519aa589890b71bf34b9bf4171dbe5a8f2b5cb409b155640e555e1","observation_id":"cb306a66-21c3-4ca9-a31a-1794d9dd62a7","resolution":{"observed_at":"2026-08-07T11:58:47.133005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.794091Z","title":"Disentangled representation learning for multimodal emotion recognition","venue":null,"work_id":"20fdcec0-ddd0-4e6e-9905-9b769d14badc","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.608214Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:9558c7495b1a62c4bad80c5ad6e24fa47d14b338f3764fdd1f87a0db58205b67","observation_id":"abd59139-02e1-435d-a24c-f2ca5b648dc0","resolution":{"observed_at":"2026-08-07T11:58:46.907855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.546648Z","title":"Tensor fusion network for mul- timodal sentiment analysis","venue":null,"work_id":"3ad0a8af-94cc-4970-b5d6-8b4ceacd5cc5","year":2017},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.742164Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:8aa8a8c2635efe2ef207b2031cd040dfffe361cc244e98b9eef135144f81635e","observation_id":"1129c12d-7252-48e6-aaf6-2ba57958ff04","resolution":{"observed_at":"2026-08-07T11:58:46.670853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.252663Z","title":"Memory fusion network for multi-view sequential learning","venue":null,"work_id":"1f66c046-ac65-4c9f-a1d2-55076a820813","year":2018},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.843834Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:e15fa8534b5dc67b360b4a0aa2aa7665c0501d64a07604a16280406ca206d1d1","observation_id":"ce7f53f3-42dc-45dd-b3ec-9a27b9195793","resolution":{"observed_at":"2026-08-07T11:58:46.412953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.933638Z","title":"Multimodal sentiment intensity analysis in videos: Facial gestures and verbal messages","venue":null,"work_id":"95bfe29c-f7da-4899-9cff-8cc5749c8005","year":2016},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.001440Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:4f4298bb1a59db134e0176a042d9f3d765f81a1413269835f9877de9f2a12f37","observation_id":"6b3618fd-9d69-44ce-858b-4ac775089ed0","resolution":{"observed_at":"2026-08-07T11:58:46.049658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.642579Z","title":"Multimodal sentiment intensity analysis in videos: Facial gestures and verbal messages","venue":null,"work_id":"1359e8cd-a46b-4c91-8358-5108adfcbae3","year":2016},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.155413Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:041afc458a9cf74c144d67659ad55e3badc91ee625af44010c8a9ba9c84aa0fe","observation_id":"cc2ab590-c864-42cc-9ecb-8436f887145a","resolution":{"observed_at":"2026-08-07T11:58:45.782901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.386872Z","title":"Multi-modal multi- label emotion recognition with heterogeneous hierarchical message passing","venue":null,"work_id":"cb9e7267-32b5-48b7-bd25-94e78919830c","year":2021},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.300181Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:2c1eb12f0c769806d9abf34c53c017bdc2d42b59ccfc234e299f59b2faabbc19","observation_id":"91d30615-0785-4e2c-8a48-97bf67bb004d","resolution":{"observed_at":"2026-08-07T11:58:45.506580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.103853Z","title":"A review on multi-label learning algorithms","venue":null,"work_id":"bd9b825e-931b-4d43-8a52-7980b4dfdc2a","year":2014},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.411096Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:100b87bda97c9d3ccc26577515ec53fe44490053db307116e54091fdd2ee4f13","observation_id":"909c6c5d-dfff-445c-8cf2-6a801e897d6a","resolution":{"observed_at":"2026-08-07T11:58:45.246829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.858472Z","title":"Tailor versatile multi-modal learning for multi-label emotion recognition","venue":null,"work_id":"efc787ad-b420-4b76-8cc2-b35863c10a1a","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.527630Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:b67a4871938335e9f3d68d0d4427f4b6318ae17a4b91c798f7a095d38d6dacb5","observation_id":"29082bb6-f489-41d7-9edd-fb6defc99e03","resolution":{"observed_at":"2026-08-07T11:58:44.965250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.572918Z","title":"Manning, and Curtis P","venue":null,"work_id":"7f0cdf0f-6714-4b93-a592-c7598c31c06f","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.649215Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:bd1647181d80dd6403190edebb1c90208c5b02c125fa2c3ee6b60f4ee07e6c3d","observation_id":"ba244c3c-8c56-433b-9be7-460865dbfa41","resolution":{"observed_at":"2026-08-07T11:58:44.703770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.292202Z","title":"Prompting visual- language models for dynamic facial expression recognition","venue":null,"work_id":"64a89b12-707c-4e9d-98f2-4c0debf44b01","year":2022},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.811706Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:6d0594c53595bc3bf50e3595538fd48f947a183e3a24f52f46a4a66faee2f6d2","observation_id":"0ea844c1-c774-4158-8c72-3a5fb3995ca2","resolution":{"observed_at":"2026-08-07T11:58:44.459062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:43.968512Z","title":"To demonstrate the diverse range of words associated with emotions, we conduct experiments to compare the performance of syn- onyms for ‘Emotion’ and ‘Sentiment’","venue":null,"work_id":"a1c74e0f-912f-4c5c-a9c6-ac779e60c586","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:42.950644Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:41c45daa9ba5106e40d22b82a9e36c0c456fbb0509337669d49afe34e3351dd1","observation_id":"beeab9aa-fa5f-480c-ba3f-6039327ce2a8","resolution":{"observed_at":"2026-08-07T11:58:44.141826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:43.664196Z","title":null,"venue":null,"work_id":"89d6db62-ca7d-4acc-b9a8-0fda51ff282b","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.066089Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:ae1214ef831922953e292c6f1eff2f33f28753818a05c1fd3006db301d944185","observation_id":"98a67b5e-ecc8-4b7c-a153-e5365ab6d229","resolution":{"observed_at":"2026-08-07T11:58:43.830165Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:43.435362Z","title":null,"venue":null,"work_id":"37795b7f-aebc-4d06-8e2d-b3261e3e258c","year":null},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:43.208707Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:599f521bc02dd96c243b94fe08be90330e863b5e68f7f341a99718cd89271406","observation_id":"427fb53b-9d71-4285-baa8-990e14555f45","resolution":{"observed_at":"2026-08-07T11:58:43.512945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.694600Z","title":null,"venue":null,"work_id":"395458ab-cf21-4269-97df-b0394aeba2fb","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":536,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:39.978857Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:a9db12f798493659125e2850e9fa81ab604d83f8a28aff1586efc2f64ed9b9bb","observation_id":"162639de-ddba-4c62-8f94-63a655e1d9a6","resolution":{"observed_at":"2026-08-07T11:58:49.864258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.210753Z","title":"2, 4, 6, 7","venue":null,"work_id":"674e0b86-33af-4234-9220-c35d281dd1e1","year":2019},"citing_paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition","version":1},"reference_index":6569,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.871715Z"},"links":{"citing_paper":"/paper/2506.00903"},"observation_digest":"sha256:21c7ba1dc357f5ba4b7c8c4648076549fac8fefe904d6bae2ddb28e218e7d55a","observation_id":"dab4dd87-d934-4ba9-9187-0ae552ea2eb9","resolution":{"observed_at":"2026-08-07T11:58:48.319086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00903","last_updated":"2025-06-01T08:42:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:52:59.355954Z","submitted_at":"2025-06-01T08:42:57Z","title":"Leveraging CLIP Encoder for Multimodal Emotion Recognition"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.00903."}