{"as_of":"2026-08-07T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69200f1b568a224dff8629dcb0d6ff3c06a7c3725c11adc6b951ac49e16a897d","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:55:16.255824Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.12777/citation-record","integrity":"/paper/2604.12777/integrity","json":"/paper/2604.12777/citation-record.json","paper":"/paper/2604.12777"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural systems for recognizing emotion","venue":null,"work_id":"ba3d6e32-bbb3-41b3-9fd2-4a1376e68920","year":2002},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:fd0e81748fee653e9ac3fbddc9c61a4facec837a0935842ba95eddb1a67a5f5a","observation_id":"ed98efab-33ff-4e63-b516-420bd56d6198","resolution":{"observed_at":"2026-05-18T11:06:18.996636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion-aware connected health- care big data towards 5g","venue":null,"work_id":"0a503bfe-cf03-4710-9600-658bb2cdcd76","year":2017},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:e052dd36fe3ad2f6efe42ba4409a0966f7ac8046611f513e5922676fe0953f68","observation_id":"1b38140f-c4f4-40ca-84fa-924b5dbaf213","resolution":{"observed_at":"2026-05-18T11:06:18.887271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning deep global multi-scale and local attention features for facial expression recognition in the wild","venue":null,"work_id":"1e8ead28-c456-4870-84ae-34418dbfcdb4","year":2021},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:4ac616ba162fa2a4603fe81decbc7252dccbe631d974e22826a1088bcbef023f","observation_id":"f01b6ceb-ec5f-41be-954d-362f3ec447e3","resolution":{"observed_at":"2026-05-18T11:06:18.943735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion recognition from unimodal to multimodal analysis: A review","venue":null,"work_id":"3d3276b7-9c39-4874-b7c7-9b3482326322","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:0a7334056072063ab676014b41937dc7a5f8be8c4a2210c46e15a3d598aa1d8f","observation_id":"934cec41-19fd-4bf4-b3d0-420e47a889a6","resolution":{"observed_at":"2026-05-18T11:06:18.883575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All rivers run into the sea: Unified modality brain-inspired emotional central mechanism","venue":null,"work_id":"4ec77c53-f420-400e-906b-bd503bc42470","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:635dee7b8ad1136404cb11b61ba4b09d6c2e4dcc3e29f536e0a55eeb5bc95ad9","observation_id":"1673538e-90ab-436e-8dfa-75200e7aa968","resolution":{"observed_at":"2026-05-18T11:06:18.917848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A systematic review on affective computing: Emotion models, databases, and recent advances","venue":null,"work_id":"3d343ed7-d1a5-40ea-8f23-9bff1532e86e","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:8ca270fca87bef3d1a953c44a54df1c9fa7ea3d0ed0c69bb6f93fe011301fad7","observation_id":"76d67c76-44bd-4798-9621-cb98b118c7f4","resolution":{"observed_at":"2026-05-18T11:06:18.954786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The neurobiological basis of affect is consistent with psychological construction theory and shares a common neural basis across emotional categories","venue":null,"work_id":"e67055cc-4c85-4fe5-81ed-acbb39550f99","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:afe236c25548520285c471bb77510e13186e344c965c0218420ecb3ad9f7d02f","observation_id":"f8ad3704-ea66-43e8-b8a0-e6de3edbfbca","resolution":{"observed_at":"2026-05-18T11:06:19.011246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotional pictures and sounds: a review of multimodal interactions of emotion cues in multiple domains","venue":null,"work_id":"213d7564-3c5a-4ba4-9065-e1af1a71eee3","year":2014},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:82391e6bc6f7c8b8237182835f4f97f4905086acc97ab006ec29ff05616cf8c2","observation_id":"429ca555-08cc-491c-883a-97f7d2ded375","resolution":{"observed_at":"2026-05-18T11:06:18.984907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The brain and its time: intrinsic neural timescales are key for input processing","venue":null,"work_id":"c14ba717-32d3-431a-ac76-ef0a76431561","year":2021},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:1a877d00923384dfd495ff2dfac5ada6c2460e297f674c721809d67fe0f9edd4","observation_id":"c5a0c0f8-eb77-4cd1-b316-b4457482254b","resolution":{"observed_at":"2026-05-18T11:06:18.940163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The cognitive– affective social processing and emotion regulation (casper) model","venue":null,"work_id":"f2238530-1a5d-4d6c-8435-a26e1ecfa54d","year":2025},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:39f74bd9d8eab335dfc4c5a9dbeafc89468acc7cc2df70671868a26e3018c6d5","observation_id":"931efdc5-06b0-474a-911e-de9ae0df51b3","resolution":{"observed_at":"2026-05-18T11:06:18.914471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15777","last_updated":"2024-08-28T13:15:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:15:25Z","title":"A Survey on Facial Expression Recognition of Static and Dynamic Emotions","version":1},"cited_work":{"arxiv_id":"2408.15777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15777","snapshot_observed_at":"2026-07-02T22:27:26.527581Z","title":"2408.15777 , archiveprefix =","venue":null,"work_id":"559b2c07-afe1-4af8-a224-08e704b65a5d","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"cited_paper":"/paper/2408.15777","citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:0ce04699991668fddb00d3cea35bfcc678896bd5b134a6f92cc245e1bc741cd9","observation_id":"148b3a31-d46e-4142-bb3d-af39ad644e65","resolution":{"observed_at":"2026-05-11T11:26:03.079087Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:04.531897Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"0c972fd9-514c-4534-a4d4-07a79bb836a6","year":2021},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:2d119b2b2fe52c358a5114211c3489c8b3578f1fa2ba123ca46aed392d23ad48","observation_id":"1a4fbe31-ae0e-4ffe-bd1a-761ee76e49f9","resolution":{"observed_at":"2026-05-18T11:06:18.922418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cliper: A unified vision-language framework for in-the-wild facial expression recognition","venue":null,"work_id":"e04d3089-1826-4008-93b6-b2099cd982fd","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:c1e209a425d97b81bad7baf993891c724506fdd0a35a90985c2d89cbd61392fb","observation_id":"1c9feff1-236f-4ca6-8f74-f1ec969709e7","resolution":{"observed_at":"2026-05-18T11:06:18.929499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring regional clues in clip for zero-shot semantic segmentation","venue":null,"work_id":"2b02d7ff-6cfc-432f-b097-bc71e5dfc7f9","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:32bfbb5c1fe6b68908cccdeb7fbbfe0d7404334bd96352251d84a5a85ee4c2b1","observation_id":"85982acc-b848-4dae-ae87-81daac1822fa","resolution":{"observed_at":"2026-05-18T11:06:19.053544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unbearable automaticity of being","venue":null,"work_id":"2ff6290c-8c40-49e6-a31b-c3e948c69582","year":1999},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:13d802e111ea731b719fe474b347f306f94dd778182c108e9e0f841472740345","observation_id":"4274a670-c179-432d-8e39-f517e0f2bb54","resolution":{"observed_at":"2026-05-18T11:06:18.932708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The theory of constructed emotion: an active inference account of interoception and categorization","venue":null,"work_id":"bf537a72-dde2-4870-af7e-c38e92d6bf77","year":2017},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:d2a3a9013797fbdc677e6e31a4ab38da79546c042310db95f58e35a77f340cbc","observation_id":"33c9380a-63d0-40a5-8aae-a0dcca49c112","resolution":{"observed_at":"2026-05-18T11:06:18.958488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical process memory: memory as an integral component of information processing","venue":null,"work_id":"14e4455f-1ddd-44a1-8782-42364115fe11","year":2015},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:da03faa88fe51541ae0f1a4d16dd01090c87aabc87c945a23d01d90ca5f375d0","observation_id":"2afd8ebe-e632-42a2-93ab-410cff1d362e","resolution":{"observed_at":"2026-05-18T11:06:19.007417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The neurobiology of semantic memory","venue":null,"work_id":"72c76409-f316-4725-a9f3-af1148132053","year":2011},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:600e2aef7b5fe23023c561e117125ffe5e16389ebd50b75f36182dcc192741ed","observation_id":"b4d6458b-ca10-4d19-86ad-ae2f5bc2f90e","resolution":{"observed_at":"2026-05-18T11:06:19.041826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T02:53:19.161312Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"bab3a606-ccd9-46bd-ad73-3786ca51aade","year":2018},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:ff74537fb337e2f2a005a6c8b34b10814d1d046ae7b1b066fa34f120bf65bfe6","observation_id":"10652338-d310-436c-ba8c-725914a30642","resolution":{"observed_at":"2026-05-18T11:06:19.046241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dfew: A large-scale database for recognizing dynamic facial expres- sions in the wild","venue":null,"work_id":"5f19689f-f40d-4566-a8e2-065dc3f584ff","year":2020},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:df809c74e76608c15cadcced153d87623aebdcb4951832513bf69f9c921e9435","observation_id":"504e9333-dc5b-4f6d-89dc-aa5f5f76bee5","resolution":{"observed_at":"2026-05-18T11:06:18.980729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ferv39k: A large-scale multi-scene dataset for facial expression recognition in videos","venue":null,"work_id":"5c2453a7-03d7-424b-b303-2e4569c11573","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:f8bb81e85264f97160fc0e78e6f2cf94a77724f70d8cd48fe4176aa820a7ab2e","observation_id":"75185c8c-e701-4f8f-ae30-4b08c7ecfefe","resolution":{"observed_at":"2026-05-18T11:06:18.972848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"ee49ed12-ad4f-4e74-8d9a-9457fff4944d","year":2015},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:8ce467efb054ac0b671020f0efec860be25943b71108e417de44fa9a7cfc73da","observation_id":"05c19fda-d493-4aa9-862f-846b8266ffb6","resolution":{"observed_at":"2026-05-18T11:06:18.992960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T17:31:23.545278Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"ef5c13c7-9df0-4e6d-97ec-348bbf80d112","year":2021},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:35e907fcd51a6f9bb058da54cabb6904e1998699bffa372ad9fccf78125409c0","observation_id":"a48a87ab-cfcb-46b1-9cde-c94a77825a9a","resolution":{"observed_at":"2026-05-18T11:06:18.876309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advancements and challenges of nlp- based sentiment analysis: A state-of-the-art review","venue":null,"work_id":"e971136a-a293-4a6d-b3e1-0be3c2593b6a","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:08229f46eeb4d507b2f3690340a6f77e150aa50a36be31b9be3c882165c4e10d","observation_id":"77489b1c-05f4-42a5-8c2d-b533ad50b431","resolution":{"observed_at":"2026-05-18T11:06:18.907324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"84d973c7-bcd6-4fde-932f-71424802301e","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:7fba969634439a80949534cf30a33eb88e5d3e65dfe34f983cd70d133bf52e9c","observation_id":"fe433572-5d83-47bc-bbff-34348ffa7fc8","resolution":{"observed_at":"2026-05-18T11:06:18.880302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:46:02.644482Z","title":"Visual prompt tuning","venue":null,"work_id":"8e03316c-4eda-4119-89e0-930976219623","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:1f861bfee0e84f4692efa042b366f987b5d60bd47deda04fae93389c50473dd7","observation_id":"3459c7b6-f4e3-4fad-a456-7d3837c72cd9","resolution":{"observed_at":"2026-05-18T11:06:18.976913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"dd8f2524-f11a-4203-a7a9-978012ae4354","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:cc1f698d5cd98c55df2dcf1f61178d82d47c4900fdf5f778fb8cafae43728e45","observation_id":"979a6d06-c336-4249-93ae-d33a04e4b815","resolution":{"observed_at":"2026-05-18T11:06:18.951278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge transfer for cross-domain reinforcement learning: a systematic review","venue":null,"work_id":"a30943b8-b4f8-4ee4-b7cb-1852ddf043d4","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:145f9199c087840365422193ec5f8bcbf9c987a494e135950849ac52f5615452","observation_id":"302da251-5243-457e-9443-44198e64f3e3","resolution":{"observed_at":"2026-05-18T11:06:18.969062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial training in affective computing and sentiment analysis: Recent advances and perspectives","venue":null,"work_id":"f1c4a661-bf05-469a-b4af-cde197138b92","year":2019},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:e5bac39345ab8f9ce66fd4bdae35c41badc06f9df40707abf0230941bedf3e12","observation_id":"ddb68ff7-2cd5-46fe-a84c-ce97bcf92e9e","resolution":{"observed_at":"2026-05-18T11:06:18.999894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangled representation learning for multimodal emotion recognition","venue":null,"work_id":"7cd8455d-cba8-428b-8329-52a27d42c969","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:729b5ebeb12981dbfc95b0f408b6f31941709855a804b4ff75ece49535197f13","observation_id":"9745ae9a-00e4-433b-ac71-498f3be9cada","resolution":{"observed_at":"2026-05-18T11:06:19.033899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ceprompt: Cross-modal emotion-aware prompting for facial expression recognition","venue":null,"work_id":"f1420414-ae2b-4f37-b4c9-75da686b3ca1","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:47b7109248c7540bec44c0173faaa2b674df3d65a65540956d163ed082b7135b","observation_id":"012a32f3-f33b-4992-8c73-3cb1dc71444c","resolution":{"observed_at":"2026-05-18T11:06:18.903232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatio-temporal representation with pseudo-3d residual networks","venue":null,"work_id":"8a8accbf-4b9f-4114-a7b2-8e7d482d75e3","year":2017},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:88b47939bc93b2e0356e55325166cde439a11f85f89569fbcf49ad0062d03ee0","observation_id":"e24f920e-394f-44c5-a7e4-0416bf440e38","resolution":{"observed_at":"2026-05-18T11:06:19.022254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"212765e1-2858-4da9-9aac-0f254275109f","year":2017},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:7e183fa64fdeece4b921e50e109baf279a94eb77136bfa0ced6c8b0d5259efa8","observation_id":"c61e4aee-4987-40ae-a504-a6d38f825b3b","resolution":{"observed_at":"2026-05-18T11:06:18.899297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"5613c849-518a-4606-82b7-abb0f7011ca1","year":2018},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:724194f7fe4a2812a2e6026b0db64b326f4fc4dfb48d2004f933ba64efd4cb79","observation_id":"b800a09e-292e-45d9-9e25-0c224d33273b","resolution":{"observed_at":"2026-05-18T11:06:18.894928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Former-dfer: Dynamic facial expression recog- nition transformer","venue":null,"work_id":"de0c0f7f-4e5c-4793-9ffb-43af975ba4c3","year":2021},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:fe8beb9365fa983991c623c64d154f6dcef4a1e7baed2d2e9c4f22c07becfb7d","observation_id":"61422f96-7352-46d2-9b88-461f2ff107d3","resolution":{"observed_at":"2026-05-18T11:06:19.018432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04975","last_updated":"2022-06-10T10:17:30Z","snapshot_observed_at":"2026-07-06T13:19:26.611207Z","submitted_at":"2022-06-10T10:17:30Z","title":"NR-DFERNet: Noise-Robust Network for Dynamic Facial Expression Recognition","version":1},"cited_work":{"arxiv_id":"2206.04975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04975","snapshot_observed_at":"2026-07-02T20:17:22.410885Z","title":"Nr-dfernet: Noise-robust network for dy- namic facial expression recognition","venue":null,"work_id":"861f0165-a0ee-4a71-b022-98516a8e4be1","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"cited_paper":"/paper/2206.04975","citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:c765169f192b8d3575d56fe4c6153404526f567ba824184c30025ed18a849678","observation_id":"1d35fb8e-457c-4cd3-9738-d7a721c5a3a6","resolution":{"observed_at":"2026-05-11T11:26:03.062346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpcnet: Dual path multi-excitation collaborative network for facial expression representation learning in videos","venue":null,"work_id":"79eb831a-b22b-4954-9c02-ae0aaaae1de9","year":2022},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:11168fbd4c6676dd2c43e38bd0c0096acc7ad0d49c1cfc9493ac5ef8bfb8eda1","observation_id":"eee6ec80-e3ad-4731-bc9b-bedb0827af3b","resolution":{"observed_at":"2026-05-18T11:06:19.014505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ex- pression snippet transformer for robust video-based facial expression recognition","venue":null,"work_id":"cdad06a2-ab28-4a91-8c80-b6e6f3f1d5e3","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:d6e1cf5a2de4535ce4517f71780a60dcfef8327e611dea2753f6cea0bc6e45e7","observation_id":"69918a2e-c1ff-4bee-8669-453f1f30a18b","resolution":{"observed_at":"2026-05-18T11:06:19.030133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logo-former: Local-global spatio-temporal transformer for dynamic facial expression recognition","venue":null,"work_id":"18d8716b-a7f7-4ee8-a2ed-60045b7659ac","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:cb5e796c8993241597ebb51991ce72da324f7228af421ed361daf471b45e1055","observation_id":"f433b118-1680-4f4e-82d0-5266abd42bb9","resolution":{"observed_at":"2026-05-18T11:06:18.947596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intensity-aware loss for dynamic facial expression recognition in the wild","venue":null,"work_id":"097bf5aa-f772-4d61-af1f-a83c77e252f7","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:04cd6b3a8ad70137b9ab0c7c8cf0c08c181297f492a23e9762d238088dbca7a0","observation_id":"4cda5f70-3945-413d-b829-f13c16c36e6a","resolution":{"observed_at":"2026-05-18T11:06:19.025974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-scale correlation module for video-based facial expression recognition in the wild","venue":null,"work_id":"254b35ac-b9f4-41d0-bc92-20162ae3d00a","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:105cb9a272a20789fa92e0e58303039f35b187a54ee64d54571f248950b74af9","observation_id":"a405ddc9-2c9b-41a6-808d-974794c6fb7f","resolution":{"observed_at":"2026-05-18T11:06:19.003705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the learning paradigm for dynamic facial expression recognition","venue":null,"work_id":"947452d7-3a78-4c1b-88a2-be2d9d0e7e75","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:5008bc03cf30f2fd7d55188900248331a236c5fe2e01ad61daa9c3fdcc4098d5","observation_id":"1025f946-f9f8-4112-8884-5937cacc00e3","resolution":{"observed_at":"2026-05-18T11:06:18.910895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frame level emotion guided dynamic facial expression recognition with emotion grouping","venue":null,"work_id":"9bdb0884-0699-4f17-9ecb-5447ef4970f6","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:d178388ad0c3163d34dd9d60a06f57c698a81c7b02775ae48780ff3a989d6609","observation_id":"8783eac5-9306-41f0-b599-8f209666e534","resolution":{"observed_at":"2026-05-18T11:06:18.891289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompting visual-language models for dynamic facial expression recognition","venue":null,"work_id":"2defa233-ba8e-4d20-8bbd-9d4818141cec","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:dc5cb68ed34144dc2765194551246c3ca867b1b861fcb67376953700eccf7084","observation_id":"9b295213-9a5a-44b4-8cc6-da20d1318c56","resolution":{"observed_at":"2026-05-18T11:06:18.925926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mae-dfer: Efficient masked autoencoder for self-supervised dynamic facial expression recogni- tion","venue":null,"work_id":"e97a993a-840a-4cd7-9f08-d6a6184535e3","year":2023},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:bf6db32d46b4a47c3892208de27243e940f28799e8c9799cbbe05d38d4b80467","observation_id":"d64f74ec-b8d4-46ae-b7b1-347f0714d87f","resolution":{"observed_at":"2026-05-18T11:06:19.037840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emoclip: A vision-language method for zero-shot video facial expression recognition","venue":null,"work_id":"1256ba73-4661-4edc-8776-8b9f5f9521e2","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:f85466bc4eab9c415adabfbb624c5ef9f8d05a477e0cd66f7860292426527a63","observation_id":"9924f3ee-4a52-4158-816a-b7e6608fe46c","resolution":{"observed_at":"2026-05-18T11:06:18.936519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empower smart cities with sampling-wise dynamic facial expression recognition via frame- sequence contrastive learning","venue":null,"work_id":"9d5a41db-aaab-460b-a9d3-eb365030de32","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:eebdaa135c5d07dad4d6715c08e385b5dcb486e8c90f8a806d3243016330a24b","observation_id":"955e9990-88e6-4034-9d5e-e5231c4e4f33","resolution":{"observed_at":"2026-05-18T11:06:18.964792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cdgt: Constructing diverse graph transformers for emotion recognition from facial videos","venue":null,"work_id":"02f2527c-c42c-4c59-9aa7-c8b06b96a883","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:ff1ebaad30c8a7d993b3574b8613fec19e5236e0fad96dbb81110187cb83d3d8","observation_id":"e1aefd7a-40c9-48fd-b66c-e940e7708c0a","resolution":{"observed_at":"2026-05-18T11:06:19.058180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A joint local spatial and global temporal cnn-transformer for dynamic facial expression recognition","venue":null,"work_id":"cb1e3313-36cf-40d1-a96e-444aa4421436","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:a4f7f6a66be2d66facef35843ae88639836ed9ec36185be8ce9be7549c3c7159","observation_id":"4d6816ef-1713-440e-b298-d8e0692de159","resolution":{"observed_at":"2026-05-18T11:06:18.961630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hicmae: Hierarchical contrastive masked autoencoder for self-supervised audio-visual emotion recog- nition","venue":null,"work_id":"3de5cd3b-dcc8-413d-b1d4-f4e4c882c382","year":2024},"citing_paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T14:55:16.255824Z"},"links":{"citing_paper":"/paper/2604.12777"},"observation_digest":"sha256:99877eca175f95cf480e296953bcc67b9fdaea74586a685e7f6adc20b8558a4a","observation_id":"ddc25506-12ed-4e56-9aa7-eec9c1be79e9","resolution":{"observed_at":"2026-05-18T11:06:19.049933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12777","last_updated":"2026-04-14T14:16:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:45:47.613840Z","submitted_at":"2026-04-14T14:16:18Z","title":"Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2604.12777."}