{"as_of":"2026-08-10T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c7de749bffa423605f44d10f91b7ecd500da5d566b1dab1f5be92d1e25c7fca","coverage":[{"denominator":184,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:23:41.714421Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T08:11:31.181704Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T08:12:30.202393Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"cited_work":{"arxiv_id":"2502.06803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","venue":null,"work_id":"11a7e186-90fb-4a54-afb7-77343035b837","year":2025},"citing_paper":{"arxiv_id":"2511.20657","last_updated":"2026-05-02T12:09:38Z","snapshot_observed_at":"2026-08-08T11:08:10.889384Z","submitted_at":"2025-10-11T07:40:36Z","title":"Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T08:11:31.181704Z"},"links":{"cited_paper":"/paper/2502.06803","citing_paper":"/paper/2511.20657"},"observation_digest":"sha256:6b98a1a58afc4aa354be7c81fed021b327d7082dad60147f750e026b8f800b27","observation_id":"1a54abac-f623-462e-9b15-1e36e99bd431","resolution":{"observed_at":"2026-05-18T08:12:30.205659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"cited_work":{"arxiv_id":"2502.06803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","venue":null,"work_id":"11a7e186-90fb-4a54-afb7-77343035b837","year":2025},"citing_paper":{"arxiv_id":"2604.09881","last_updated":"2026-04-10T20:15:38Z","snapshot_observed_at":"2026-07-06T22:58:38.807460Z","submitted_at":"2026-04-10T20:15:38Z","title":"Toward using Speech to Sense Student Emotion in Remote Learning Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:58:53.767679Z"},"links":{"cited_paper":"/paper/2502.06803","citing_paper":"/paper/2604.09881"},"observation_digest":"sha256:7f32c3cb8f9134ecaa8095f32d5d62c17fc586c577b8f6c60ec7231bda51e421","observation_id":"acd11eed-2e23-44ab-b44a-6ff090f87681","resolution":{"observed_at":"2026-05-11T09:31:04.445450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06803/citation-record","integrity":"/paper/2502.06803/integrity","json":"/paper/2502.06803/citation-record.json","paper":"/paper/2502.06803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.161794Z","title":"Recognizing action units for facial expression analysis","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.161794Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:5071f63c873850fda9c7e017f634a771ede39a62ed29c3e508b619e1cd355310","observation_id":"beda2922-13e8-45ce-a1ab-3e6fe622ea6c","resolution":{"observed_at":"2026-08-09T18:23:40.161794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.166277Z","title":"Face validity","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.166277Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:10cd4c0e13457128f8ee4f773dbb0a8e634046ecaf246b0044fb5d878c2e41e0","observation_id":"4d404500-c273-4822-a83d-aace464d3b28","resolution":{"observed_at":"2026-08-09T18:23:40.166277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.169877Z","title":"The expression of the emotions in man and animals","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.169877Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:7b932d10659fea3367b74a0acef5faad1eb4a4ad59f0364920564848b2cb56f8","observation_id":"4c77b3b7-1aa5-45d6-8399-a8ba6e0691d8","resolution":{"observed_at":"2026-08-09T18:23:40.169877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.173066Z","title":"Constants across cultures in the face and emotion","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.173066Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:f1a7794c298e8782a44a9386d3bd21ebec01ba7a437f32736879a7023c7791e5","observation_id":"854aa87f-c81b-40c0-829c-715679f6529c","resolution":{"observed_at":"2026-08-09T18:23:40.173066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.176296Z","title":"Strong evidence for universals in facial expressions: A reply to russell’s mistaken critique","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.176296Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:e701dd18773b3113fde1c5134c7f1cddde1880b398791a3da7143f064c8b160e","observation_id":"9bfc6b87-b753-4aa4-9f46-ebc8d930a338","resolution":{"observed_at":"2026-08-09T18:23:40.176296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.179806Z","title":"Einfochips","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.179806Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0bbcc5c41a824e429c4b0da3e8a5255b2a5423aee386adea62fc15bf1acfc8f8","observation_id":"26a0f0a8-3a64-40b1-b66b-1cad15958af3","resolution":{"observed_at":"2026-08-09T18:23:40.179806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.184128Z","title":"Elevate AI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.184128Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:3d298fbda176c5d79f35b0ca1b409c7c5590ec1e1fe55ad65a4d853c6a943d47","observation_id":"34950c73-5c95-45bf-bf78-dd2f02f9e7c6","resolution":{"observed_at":"2026-08-09T18:23:40.184128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.187471Z","title":"Facial expression recognition of emotional situations in mild and moderate alzheimer’s disease","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.187471Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0876eb69bddc40ab8fff4fc99c8a108be636df1adb8de864383439e2afb0d0e4","observation_id":"8433dcde-65b4-4630-aa39-071b50cc9fc5","resolution":{"observed_at":"2026-08-09T18:23:40.187471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.191501Z","title":"Mental states and personality based on real-time physical activity and facial expression recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.191501Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:c43a060d10c5dec6dae47629690b16b8dc0ae1e8725edd489920b236ecb57421","observation_id":"75f3db6d-542e-48c7-a9b8-bb26f2c0d193","resolution":{"observed_at":"2026-08-09T18:23:40.191501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.194412Z","title":"Using a social robot to evaluate facial expressions in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.194412Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:9c4ba3c0582bb2b63836ac0470c81523fecefcb20ffa864c2e9d8b4ce3c99ff2","observation_id":"c8e50d2e-8b97-4967-9aa8-9b9a0388d4cf","resolution":{"observed_at":"2026-08-09T18:23:40.194412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.221297Z","title":"Classroom teaching evaluation based on facial expression recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.221297Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:feaa3871b15b1e6511a0933ba6da9966542a65cf789c7216a76600d2d283e442","observation_id":"14ea9be0-3df6-4ee0-8e9f-6b3684b44064","resolution":{"observed_at":"2026-08-09T18:23:40.221297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.290991Z","title":"Driver fatigue detection based on deeply-learned facial expression representation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.290991Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:8b78287e63d29591f834469485e2779b7891a081a837f833e09cb38501c90c8a","observation_id":"9b3994ca-7d84-41b2-985d-1ffb251525ea","resolution":{"observed_at":"2026-08-09T18:23:40.290991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.395899Z","title":"An accurate facial expression detector using multi- landmarks selection and local transform features","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.395899Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:7969d26be3eb967ebe22d50b6cbd14ebfe90e83524afad735cefcdba66ae01c5","observation_id":"2fc86798-e12a-4a6a-b8a3-7eaff4d2a43d","resolution":{"observed_at":"2026-08-09T18:23:40.395899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.419680Z","title":"Societies becoming the same: Visual representation of the individual via the faceapp: Application","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.419680Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:2c7977501863ea672e27096d46e0f0c4a7c1136641d55a4bb59d5f3a42df5162","observation_id":"a8f2704d-bce0-4f78-bc38-e3625287de71","resolution":{"observed_at":"2026-08-09T18:23:40.419680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.478755Z","title":"Is there an app for that? a review of popular apps for depression, anxiety, and well-being","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.478755Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:514efe9ba7a7c884df8099d207b0de611728a1e9d5b2dc10600831bd1c76d287","observation_id":"35a7923c-1d0e-4b26-9c8d-27bc61a2dbf3","resolution":{"observed_at":"2026-08-09T18:23:40.478755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.511038Z","title":"Evaluating the therapeutic alliance with a free-text cbt conversational agent (wysa): a mixed-methods study","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.511038Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:513defdae0b69343d0cdd0dcf98980f26d31ee392a2622ed1eb2d9c03278aee8","observation_id":"8c321925-e301-4201-a618-fab2160c1d77","resolution":{"observed_at":"2026-08-09T18:23:40.511038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.527281Z","title":"Rashmi Adyapady and B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.527281Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:ba080d43074e602029977485d6fc8d1808daec2382fa1d3f4adfbe7021dd0a2e","observation_id":"4df85d99-fc39-49a7-a5e8-1eb260bd6286","resolution":{"observed_at":"2026-08-09T18:23:40.527281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.530148Z","title":"A survey of textual emotion recognition and its challenges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.530148Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:f41d6e7026e69cb99217b488e3b7df3c9fb4a8a862793495c5d04a6e42359288","observation_id":"e72b6059-ac68-4d62-8ee3-54285f14876d","resolution":{"observed_at":"2026-08-09T18:23:40.530148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.533886Z","title":"Speech emotion recognition: a comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.533886Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0bb1efe840a624a294c4140c6a38cc48e4eb5b111b897c1b7b579d1df5a39a75","observation_id":"01c4fde6-2130-4465-bccd-95673480c42c","resolution":{"observed_at":"2026-08-09T18:23:40.533886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04226","last_updated":"2023-03-07T20:36:13Z","snapshot_observed_at":"2026-08-09T08:26:36.720121Z","submitted_at":"2023-03-07T20:36:13Z","title":"A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04226","snapshot_observed_at":"2026-08-09T18:23:40.537053Z","title":"A comprehensive survey of ai-generated content (aigc): A history of generative ai from gan to chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.537053Z"},"links":{"cited_paper":"/paper/2303.04226","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:c84a061be45814739053d6dec94f9377bdae5e1e2191072e23ed17a86f33e6fc","observation_id":"28059e98-a5dc-4817-b3d3-ee7e579d24b9","resolution":{"observed_at":"2026-08-09T18:23:40.537053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.540695Z","title":"A comprehensive survey and analysis of generative models in machine learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.540695Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:a8381ed229169c0099feaa8870cd88955583eb84fcf8f21f7b0f4efbaaa26564","observation_id":"9f0613dd-65fa-4ebf-a00c-b8dae0dbbcda","resolution":{"observed_at":"2026-08-09T18:23:40.540695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.544111Z","title":"Deep facial expression recognition: A survey","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.544111Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:48dd8f524038316b0aeffa584ae2241aeea1cd7aad6d51f1c83c0a53227579eb","observation_id":"79652fa7-6f57-483a-8ba2-5f17a5b60395","resolution":{"observed_at":"2026-08-09T18:23:40.544111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.547174Z","title":"Estimation of continuous valence and arousal levels from faces in naturalistic conditions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.547174Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:a366d25888ec6a641b223eeb6736384f0debd88a5ab90f6fcc68c41061e67ac4","observation_id":"4139ea0a-a966-4dc3-8f2c-fa2c72787b57","resolution":{"observed_at":"2026-08-09T18:23:40.547174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.549613Z","title":"Training and profiling a pediatric facial expression classifier for children on mobile devices: machine learning study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.549613Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:8c4445db747ac1d92dcc7e4b910c839be856c311cfedd23ccb0cb1d8f24139ab","observation_id":"57232e12-81d5-4da9-bd0c-120586528c50","resolution":{"observed_at":"2026-08-09T18:23:40.549613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.552609Z","title":"Effects of digital avatar on perceived social presence and co-presence in business meetings between the managers and their co-workers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.552609Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:b54871bd51ab7ab876c4fd0441f67d47b9b344ebbac59711734badedfcd0d724","observation_id":"44cc974e-8483-4a77-a5a7-b85da8357097","resolution":{"observed_at":"2026-08-09T18:23:40.552609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.556101Z","title":"i’m here for you","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.556101Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:7f2b6de90aed90f269e19058d75b6ac27f4d8b3256ed5952b100e162841957b8","observation_id":"1fabcdd8-c19c-4c31-831d-ec34cec902cb","resolution":{"observed_at":"2026-08-09T18:23:40.556101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.558769Z","title":"CharacterAI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.558769Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:c9e9f577f248d3531984dd3faee63344ebd55c1445af47accc8c4bb7c152b222","observation_id":"97db5e8e-fb3e-4107-8df0-fbebd23dca5f","resolution":{"observed_at":"2026-08-09T18:23:40.558769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T18:23:40.561707Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.561707Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:d48d2a13d8cb1c5339e8174dfe101cf120735cea653116cad5371db63d5ecadf","observation_id":"de55a1f6-de86-4b3e-bf8e-d1429fe28dee","resolution":{"observed_at":"2026-08-09T18:23:40.561707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.565379Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.565379Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:f1399b4c13e543833e414ee453c5432a203b0e549cf061e0911f9a0b3f620324","observation_id":"4541089c-8925-4961-a49d-c390ac7e8b27","resolution":{"observed_at":"2026-08-09T18:23:40.565379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-09T18:23:40.568603Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.568603Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:a32b24ee7b87fd33aef9b670551f005e76c282f41c99437428b9ec4208274756","observation_id":"9553a62c-7380-4078-b6f0-5031976fc03d","resolution":{"observed_at":"2026-08-09T18:23:40.568603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.571841Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.571841Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:cb569c18a22a206b257c61c79fb8acd54057c334f4189ffb6c377631bcd66886","observation_id":"d5f6b060-ac27-41cf-94c4-573a0c210998","resolution":{"observed_at":"2026-08-09T18:23:40.571841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.575149Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.575149Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:76ffcb754c89e50f09a646fbf15b22b3f5ea987bff87aca522f7cde65ed6d2c7","observation_id":"3656b937-5f65-4070-80fd-e038aaf05297","resolution":{"observed_at":"2026-08-09T18:23:40.575149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.578126Z","title":"Gonzalez and Richard E","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.578126Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:48e835ea8ace84e0cd648eb489b70e61bd38ebdeeca875f7cd9006255aba74fd","observation_id":"a9b81b1a-e776-4c47-9861-7667a59c9dc4","resolution":{"observed_at":"2026-08-09T18:23:40.578126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.581385Z","title":null,"venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.581385Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:16fd1873d6ad86e62bc0271241d5fd3a385fa6703a2b26c9bcb20c78882ac1d7","observation_id":"e7dd79f4-b162-4a71-adda-11f35d97e8e0","resolution":{"observed_at":"2026-08-09T18:23:40.581385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.585390Z","title":"Pizer, E","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.585390Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:92d16befe705292189a8bf63ff517ff5aba6075f7ae103ae3d74f9699e9b1b58","observation_id":"9f26eb2b-336e-4073-b59c-328798238bcd","resolution":{"observed_at":"2026-08-09T18:23:40.585390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.588567Z","title":"Khoshgoftaar","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.588567Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:5a7b94bfcc15abf99d830fe2a8e250397a25e8fa176526ff9214796385c1f19d","observation_id":"5aa3c4df-7663-40b3-8e9c-b478b03976fc","resolution":{"observed_at":"2026-08-09T18:23:40.588567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.591413Z","title":"Rapid object detection using a boosted cascade of simple features","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.591413Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:025aeec8b3925b217416ef78f8247919f9fe925b821d7a24dfa9a64526341087","observation_id":"9feb12bd-59af-40ea-a4b5-88ae0334df8a","resolution":{"observed_at":"2026-08-09T18:23:40.591413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.594480Z","title":"Facial landmark detection by deep multi-task learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.594480Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:701725414bc91b5a72afe66e359974c55f07df519484236bb17e87a39d75f5f4","observation_id":"bb8f1197-32bc-4d7c-b39d-78317d946c5a","resolution":{"observed_at":"2026-08-09T18:23:40.594480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-09T18:23:40.597500Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.597500Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:87839eea651ade8a3e369cfc2fac27b22805776ab5f56e6dddc48c64c303cc20","observation_id":"a3fd1309-53a1-4bef-95b3-ed1997f78f91","resolution":{"observed_at":"2026-08-09T18:23:40.597500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.600640Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.600640Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:d326f87ef812328a2926cf6610b0010c41da99f30a3eb43696ab83494e7e269c","observation_id":"bc8c95f3-b464-4eb5-865c-c74b6727a660","resolution":{"observed_at":"2026-08-09T18:23:40.600640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-09T18:23:40.604374Z","title":"Howard, Menglong Zhu, Bo Chen, Dmitry Kalenichenko, Weijun Wang, Tobias Weyand, Marco Andreetto, and Hartwig Adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.604374Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:efde0a59e1f338db8831e7e8f1fb84408ad21a8daa3ee9f6dfcdf13e60a0de0f","observation_id":"410bdee7-fbe6-487a-967a-9244a3923e09","resolution":{"observed_at":"2026-08-09T18:23:40.604374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.607707Z","title":"Bovik, Hamid R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.607707Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:40e3379b8912329751626fcc5cd2742204f389749213a09aebad7ba8f77e1783","observation_id":"eb3aa6f7-cc27-4e1f-8a4a-684889fe27ae","resolution":{"observed_at":"2026-08-09T18:23:40.607707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.610874Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.610874Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:f85a1d0140f940c4e46bb18a5c6c2963cf1cbd507486112396fa1f710cf60ee0","observation_id":"a87e8697-40be-45b3-839d-7e81e6fa351c","resolution":{"observed_at":"2026-08-09T18:23:40.610874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.658446Z","title":"Lim and Alan V","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.658446Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6f873b5fefeb7a102e67154651d5457b51db716e4bb5e1b8af007e86e13ad37b","observation_id":"de65084c-b8de-49cb-bd54-e81938b9f2bc","resolution":{"observed_at":"2026-08-09T18:23:40.658446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.704614Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.704614Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:7b1f8053233ebc34b7062849f19ae207e45fec604c70cbcb28bd3083247de561","observation_id":"ba7a4d74-3f90-476e-93d4-a604841f81fc","resolution":{"observed_at":"2026-08-09T18:23:40.704614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.745515Z","title":"Fundamentals of Speech Recognition","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.745515Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:81914c0e54542de2275b11ea9971b667888dbe50b1d5410c096437ca099648dd","observation_id":"a6fe2de6-afb4-4f1d-8890-e503a8c1519e","resolution":{"observed_at":"2026-08-09T18:23:40.745515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.807806Z","title":"Rabiner and Myron R","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.807806Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:d1267548831d93a3e369fa3da6bf7a9d03c7f2225382cc6c4af0f89c964d7533","observation_id":"b90190be-6ada-42d8-99f8-89521a13e073","resolution":{"observed_at":"2026-08-09T18:23:40.807806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.883439Z","title":"Sadjadi and John H","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.883439Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:dfa7556e1d335615cfc70f318ca1e58e3d5d743643b7ba415eb746bc9e33c34c","observation_id":"2dc9be43-436b-4e7f-b9d5-68d469c57bdb","resolution":{"observed_at":"2026-08-09T18:23:40.883439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.955146Z","title":"Davis and Paul Mermelstein","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.955146Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:ee948e2d4afdb021e2d5ac3ea77be1c0af0fd34ee02ab706f46372f1c2ce2100","observation_id":"6890787d-148e-41a5-8272-379da1c42da7","resolution":{"observed_at":"2026-08-09T18:23:40.955146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:40.996422Z","title":"Linear prediction: A tutorial review","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:40.996422Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6297d8abe06de97661923dd5d0ba8d7e63ae525a12dc192fb98da1a454ede78d","observation_id":"3f204197-4e38-4a79-a5a6-123a0598c955","resolution":{"observed_at":"2026-08-09T18:23:40.996422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.065579Z","title":"Accurate short-term analysis of the fundamental frequency and the harmonics-to-noise ratio of a sampled sound","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.065579Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6a0c88d026f20032a0ea03992b1658fe288b4f9c64cb0869bc21bac3869d930d","observation_id":"7cf073b0-1036-46e3-bfe3-c8a408114baa","resolution":{"observed_at":"2026-08-09T18:23:41.065579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.090086Z","title":"Crochiere and Lawrence R","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.090086Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:d669c1bfb10f18aaba918f2d77a607c4250540b0c999e71fab66b3189b39dea3","observation_id":"a160825d-d286-4ce5-b55f-31812fa77f6b","resolution":{"observed_at":"2026-08-09T18:23:41.090086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.094272Z","title":"Speech dereverberation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.094272Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:a632e5b20326e158e34b0e58d9ff369f452b8ff0caea0505108c77919479fe28","observation_id":"295810fb-5aff-47e8-9e3d-ad01aea2da54","resolution":{"observed_at":"2026-08-09T18:23:41.094272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.096877Z","title":"Speech enhancement using vector quantization and a formant distance measure","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.096877Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:390ac8e4c375d0a2eedfd42b03d8ee51032f15cef62498b598f1897a4e4f4034","observation_id":"eab26263-1072-477a-9459-7864844d89fe","resolution":{"observed_at":"2026-08-09T18:23:41.096877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.100174Z","title":"Frame blocking and windowing speech signal","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.100174Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:b168a44d9e82aaf56adfbc530e3c9c5419a91abd3bd291ef27ecad1a40c99443","observation_id":"dd083f21-c3cb-4d75-a59b-a5df5544f54c","resolution":{"observed_at":"2026-08-09T18:23:41.100174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.103378Z","title":"A recursive feature vector normalization approach for robust speech recognition in noise","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.103378Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0510f09661948eb3673c2add4a350d2add5e376b1b38ef1373a83b95bb73bee4","observation_id":"672bb539-247f-4f95-947e-e1d44f1f818f","resolution":{"observed_at":"2026-08-09T18:23:41.103378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-09T18:23:41.106917Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.106917Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6ba59012b4306e22420f891a5b09ae96a5f2cde91c38020bcbcee739332ec6c2","observation_id":"b66930f4-7859-4192-9526-cbc0f876d261","resolution":{"observed_at":"2026-08-09T18:23:41.106917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.110425Z","title":"Manning, Prabhakar Raghavan, and Hinrich Schütze","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.110425Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:750d09f2351e1515be66e2c90b87736155a03cd41a5d0b596fa82cd8355e4810","observation_id":"bc60aa5a-92ec-4a17-9b63-fa1edaa80b51","resolution":{"observed_at":"2026-08-09T18:23:41.110425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.112915Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.112915Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:95ab58d299c447e9e34cc42577cb4331cf03666541190858fe6dc8e3d16cfc1f","observation_id":"efc139ac-36e1-4833-a546-ed3948bfd02a","resolution":{"observed_at":"2026-08-09T18:23:41.112915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.116638Z","title":"Natural Language Processing with Python","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.116638Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:9315bf932add45b2ceabc852a6babd9229914b7f26b3cced0eee175e04652a32","observation_id":"6c1d1d82-8a7d-45b1-906b-ca2295f96227","resolution":{"observed_at":"2026-08-09T18:23:41.116638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.119984Z","title":"Ghosh and D","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.119984Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:050142ae5f503b14f3400071d7066271550b03848c0053c817daf95e7e2db011","observation_id":"58d02215-2b4d-4d21-a39c-8013d568284c","resolution":{"observed_at":"2026-08-09T18:23:41.119984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.122380Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.122380Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:33e774db5d6a8f90d93f5a6683506b5ac9347317389d6ce386d67ba67a35f0f2","observation_id":"8bac9a3f-d202-4ff8-9129-a57f2bcaeb17","resolution":{"observed_at":"2026-08-09T18:23:41.122380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.125732Z","title":"Neural Network Methods for Natural Language Processing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.125732Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:adaf481840f8402f3f2c3e8930b843f4e711376bd69a30e256dd87f9ddf8c452","observation_id":"bf718b1a-a1dc-4283-97b7-ed3a8c315868","resolution":{"observed_at":"2026-08-09T18:23:41.125732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.128269Z","title":"Corrado, and Jeffrey Dean","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.128269Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:c7d3a8bea4e81a2cf484a78368601805898cb5b86c6c43f8babd4460064cfbb3","observation_id":"49324b47-44c9-44e9-a647-308b6751d46b","resolution":{"observed_at":"2026-08-09T18:23:41.128269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.130797Z","title":"Deep pyramid convolutional neural networks for text categorization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.130797Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6d16b40c5a00c3762f8a75a1869def3f818b7dd53d83b40fd4865a808a4eefb0","observation_id":"7d3746a9-d25d-4817-82bd-3c00cee4174d","resolution":{"observed_at":"2026-08-09T18:23:41.130797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-04T05:32:13.942920Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-09T18:23:41.133777Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.133777Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6da5b9737d1ee2e3edc907b7513ad1e9d7d3afa8dab79ec2acf37dc610cdc733","observation_id":"5b2e7366-14c3-4faa-88fa-17c30b7c5428","resolution":{"observed_at":"2026-08-09T18:23:41.133777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.137517Z","title":"The interspeech 2010 paralinguistic challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.137517Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:15129e319fdfe2807893b09fc44221d84fbdab1fb3286030789119f161a2aba1","observation_id":"1855cf87-b441-4746-9923-4430884ecaac","resolution":{"observed_at":"2026-08-09T18:23:41.137517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.140598Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.140598Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:2498620a39bbb7400b382e46b361d84c64bab90393bb8660c0a737f84053fe83","observation_id":"80eac8f9-f74e-48b1-9da2-79862b050766","resolution":{"observed_at":"2026-08-09T18:23:41.140598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.143767Z","title":"Littlewort, J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.143767Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6aad26cbd60c15d35743b426eeac3ef35da493b1ebcea0d61cfc61e35ec4e5f2","observation_id":"04173aa1-7299-4248-b25f-f62cd75dc63d","resolution":{"observed_at":"2026-08-09T18:23:41.143767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.146727Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.146727Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:4607662692b5f6c434c22744f2d16222cdf42629e3ed168b17619e2a9fdfe111","observation_id":"e23c17b4-2e1b-46ae-b4ed-ae1f5b648490","resolution":{"observed_at":"2026-08-09T18:23:41.146727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.149377Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.149377Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:897ef0bde95874b58c2c8e13c00fabae6001f6035530bce476e641467a12e4cb","observation_id":"90ab65f3-0105-4706-9701-56c4fe264ae5","resolution":{"observed_at":"2026-08-09T18:23:41.149377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.152674Z","title":"Challenges in representation learning: A report on three machine learning contests","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.152674Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:ff19bb707ce4280bf1954ef997924c085f8c70b7c9b2f3ce448ef760e78487fd","observation_id":"7981a0a5-11dd-4d1e-a25f-4af1ddd7fbb5","resolution":{"observed_at":"2026-08-09T18:23:41.152674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.156237Z","title":"Emoca: Emotion driven monocular face capture and animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.156237Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:2aacc93430c03349bcd9fc89a5474ed2fb5d4aeaeb0479ce5c598abdc135a7e6","observation_id":"cd0e0dd2-9314-4834-89b5-2e3746770cf1","resolution":{"observed_at":"2026-08-09T18:23:41.156237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.159071Z","title":"Abaw: Valence-arousal estimation, expression recognition, action unit detection & emotional reaction intensity estimation challenges, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.159071Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:020bbf73f545ebeebfeb812d994defa2d56abde16882e34863ce2df4965b9d93","observation_id":"29e19bf9-42c5-453a-aca5-03423984fd44","resolution":{"observed_at":"2026-08-09T18:23:41.159071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-09T18:23:41.162678Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.162678Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:9cd28ffed0aaf1c39106348fdbe191cee40b639f2c4ceb8fd261953581a2de49","observation_id":"052d4904-f9d5-454e-a894-4a8fd74dd5ed","resolution":{"observed_at":"2026-08-09T18:23:41.162678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13382","last_updated":"2024-11-26T16:37:36Z","snapshot_observed_at":"2026-08-09T12:56:13.219816Z","submitted_at":"2023-08-25T13:52:05Z","title":"Prompting Visual-Language Models for Dynamic Facial Expression Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13382","snapshot_observed_at":"2026-08-09T18:23:41.166617Z","title":"Prompting visual-language models for dynamic facial expression recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.166617Z"},"links":{"cited_paper":"/paper/2308.13382","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:ccdbc8adb69d508c87e71d1c1572817d67e1ed70d057eee60e69a1d385778517","observation_id":"01de7f38-3907-49f1-b182-c983e09764a2","resolution":{"observed_at":"2026-08-09T18:23:41.166617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.183654Z","title":"Patch attention convolutional vision transformer for facial expression recognition with occlusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.183654Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:e14d69e6d7ddb89003ded2397deb644c21b028b485296619881276ade4e673df","observation_id":"6b216eac-4801-4466-9e65-557584990cbf","resolution":{"observed_at":"2026-08-09T18:23:41.183654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.211644Z","title":"Poster++: A simpler and stronger facial expression recognition network","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.211644Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:bffc37df39877b0dd2268e738fe334772fbd21bcb68122cb34787be4024f1c8c","observation_id":"3ce8a503-84fe-4f5f-a0ac-c366947dcf86","resolution":{"observed_at":"2026-08-09T18:23:41.211644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.258617Z","title":"Enhanced spatial-temporal learning network for dynamic facial expression recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.258617Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:1bde2ba782ebedc8853b8b3411e7575326e2494b46ce199082f3d6b3a2b7e38e","observation_id":"1a25d5fa-20f5-49e7-a8c1-58bf90d87a2f","resolution":{"observed_at":"2026-08-09T18:23:41.258617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.330056Z","title":"Towards accurate marker-less 3D facial performance capture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.330056Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:dbb5145ca5fbbe08db91154329a8a48cd104403eb04cd64b3d32d84cccf9e669","observation_id":"e5b11c65-2706-409c-89be-a40a45f85af2","resolution":{"observed_at":"2026-08-09T18:23:41.330056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.363513Z","title":"Speech emotion classification using attention-based lstm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.363513Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6eec56953441a492246fe551773f143d95ded75db7c57a11771ef98c32191fcb","observation_id":"d40e65d1-dd69-4720-88de-2f3b381eec21","resolution":{"observed_at":"2026-08-09T18:23:41.363513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.410469Z","title":"Hidden markov model-based speech emotion recognition","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.410469Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:eef943a17d4562b8bbfed8af71cbed247fd77291e55cb143aa1b1316dfa93509","observation_id":"7940ad25-1cc8-4163-a7a1-518667aea96f","resolution":{"observed_at":"2026-08-09T18:23:41.410469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.440740Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.440740Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:83d2620e3c2f38850a01af633d7859f94c063819aed4c220f246b4fe36a0d239","observation_id":"a3a0327e-03b0-4d00-afc4-87a49aaa87a6","resolution":{"observed_at":"2026-08-09T18:23:41.440740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.467892Z","title":"Exploiting emotion-semantic correlations for empathetic response generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.467892Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:13295b6b1bfe870174f987a7b868c81c595286badabaff968048a246634f120d","observation_id":"9556a759-fc9e-499e-bd63-37ff111ce7ec","resolution":{"observed_at":"2026-08-09T18:23:41.467892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.493970Z","title":"Speech emotion recognition using deep convolutional neural networks improved by the fast continuous wavelet transform","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.493970Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:23e2fc297bbb4acf49aaa4849312613417ce09ac6595b0ea978bfea5504dea0a","observation_id":"ddd42921-95c9-405d-bfb0-f3001f91fd1a","resolution":{"observed_at":"2026-08-09T18:23:41.493970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.561065Z","title":"A bert based dual-channel explainable text emotion recognition system","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.561065Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:ca12bb4b9ee30b673d3ca6a1d35568dae5654c6de1010900dad080fd5b9fe293","observation_id":"4f2d4349-f21c-4a31-adba-14f1bd126131","resolution":{"observed_at":"2026-08-09T18:23:41.561065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.636295Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.636295Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0fafbd71d506d3e87d9166645ace0b7d83bccc820b4e63372c9d33ac84e8aa42","observation_id":"1f71185e-17ac-437e-bf54-892ee65b78e6","resolution":{"observed_at":"2026-08-09T18:23:41.636295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T18:23:41.674173Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.674173Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:007401fcb297a29b927a79c00a3f8942b8971b4b84975850a1620d824fa3fd32","observation_id":"e67d691e-fda9-45a9-9917-a0a191cf0cd4","resolution":{"observed_at":"2026-08-09T18:23:41.674173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.677571Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.677571Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:e954960de542470ccb083ed6c25dbeaf2fffb3a74bd694aac37bb00689b3e4e4","observation_id":"754541b2-f5db-4e16-af69-5650d8abb5dd","resolution":{"observed_at":"2026-08-09T18:23:41.677571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.680344Z","title":"Srl4e-semantic role labeling for emotions: A unified evaluation framework, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.680344Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:fc45e33e7ec197b8d3f9ad45b0bad386989d796d5e9be2183db78547786fec2a","observation_id":"ffc7c910-bba9-4255-a36b-0f23c457a73b","resolution":{"observed_at":"2026-08-09T18:23:41.680344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.684202Z","title":"Clarin-emo: Training emotion recognition models using human annotation and chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.684202Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:73aeed1d30fd3ea48adc37905eec87a514042796419f311fc8247f3680af86ba","observation_id":"bd2ad9e4-b1b3-4b89-b787-b691c96fe545","resolution":{"observed_at":"2026-08-09T18:23:41.684202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.688305Z","title":"Xlm-emo: Multilingual emotion prediction in social media text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.688305Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:0210952b3f6103737f824c054fc4b46d9ad7e6770aa15b367d2c94d9da1dd2d0","observation_id":"28da0495-4efa-4207-b111-27a3bed231af","resolution":{"observed_at":"2026-08-09T18:23:41.688305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.691864Z","title":"Dual attention networks for multimodal reasoning and matching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.691864Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:3e294365017d96dfb6038371ffbb31da9ca33ff80d2a0b1813039f2ddd1f8ef2","observation_id":"e0cfb7cb-50c9-45da-9ffc-f5c3a74aa50e","resolution":{"observed_at":"2026-08-09T18:23:41.691864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.694678Z","title":"Acoustic emotion recognition: A benchmark comparison of performances","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.694678Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:6ed885e0c8f90c64a1e610fc40ac31264c981e28fd4fa48b9b5c3365dee3b59c","observation_id":"b229e58b-49da-4d56-bfdf-db040ada4690","resolution":{"observed_at":"2026-08-09T18:23:41.694678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.697634Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.697634Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:eec89a778e4ea327776768c9cb0f81df165922859f0e35aefeca33c9a9d71546","observation_id":"b438dfff-20e8-434e-bfb8-0b4a0c033a87","resolution":{"observed_at":"2026-08-09T18:23:41.697634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.700291Z","title":"A review of deepfakes and an analysis of detection methods","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.700291Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:f22520dc4389f2c1dc4075dfd554b0f1190c7ba04c6cbe7892466091ac66fec0","observation_id":"702377d2-782a-44f3-ad11-970edb047835","resolution":{"observed_at":"2026-08-09T18:23:41.700291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-09T18:23:41.703667Z","title":"The deepfake detection challenge dataset","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.703667Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:faff670f393237eb67b22fc21cd4853527c57b0bfe2fd837264fd98ce877f078","observation_id":"08189a9d-442e-4979-91d3-05d34131f8db","resolution":{"observed_at":"2026-08-09T18:23:41.703667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.707351Z","title":"Deep Learning, volume 1","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.707351Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:3a430ec81e35c35245eb2b0e05ed9768178291083576fa7f246ba4f6a4e7bb2c","observation_id":"209d125a-94f7-4ecf-bdd4-31cd7df58480","resolution":{"observed_at":"2026-08-09T18:23:41.707351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.711296Z","title":"Emo: Emote portrait alive – generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.711296Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:aa281be77f33215d6b582762bd6a9aaffab0169d2559de65dab8f53730c5f0f7","observation_id":"1bc4b772-29ea-4f0f-8bbc-5ef1ac8f621e","resolution":{"observed_at":"2026-08-09T18:23:41.711296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:23:41.714421Z","title":"Instagram","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:41.714421Z"},"links":{"citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:a0d4489205590b5afbe679912745109ec556e222ed70d52c0e2947585aab01e6","observation_id":"4a1816d2-975b-4c6b-8792-99c9bccd8187","resolution":{"observed_at":"2026-08-09T18:23:41.714421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:58:57.584422Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":184},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 184 outbound references and 2 inbound Pith citation observations for arXiv:2502.06803."}