{"as_of":"2026-08-07T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:641672242692e57c379189e12b6b73282a5b93e427f3304743b7c3f5c4794e65","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:08:58.980743Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11892/citation-record","integrity":"/paper/2507.11892/integrity","json":"/paper/2507.11892/citation-record.json","paper":"/paper/2507.11892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.937963Z","title":"The extended cohn-kanade dataset (ck+): A complete dataset for action unit and emotion-specified expression,","venue":null,"work_id":"90e56f50-e49a-483b-89d5-8c97f5b9d073","year":2010},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.233116Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6906429f9f4032a67d5e9610c34d6fc5e6c053d3e0329d927e97c7f612cab09f","observation_id":"2f80eff5-5e07-4e4f-bc11-824bde58144a","resolution":{"observed_at":"2026-08-06T17:09:10.037724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.662711Z","title":"Induced disgust, happiness and surprise: an addition to the mmi facial expression database,","venue":null,"work_id":"771caf24-484c-474a-b69a-32614b2df2cf","year":null},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.371685Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:79f3714b6d051353717a01c277e868e2a7ebc1b9124e38f72b568e91d8e8adff","observation_id":"8f33e461-9f0b-45e0-87f3-fc36ada3e9af","resolution":{"observed_at":"2026-08-06T17:09:09.788431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.383483Z","title":"Facial expression recognition from near-infrared videos,","venue":null,"work_id":"651bd157-2948-4c82-bd26-a8fb07748956","year":2011},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.524779Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:4b75861588a5cddc7c855e5a5f025520845ef684b8fd9c79d89751513e6b227d","observation_id":"c7d2cc0f-ba65-45e7-82ba-d384efa2e394","resolution":{"observed_at":"2026-08-06T17:09:09.507381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.040863Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild,","venue":null,"work_id":"2867517c-af36-47bf-a672-f5611547b60a","year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.678700Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:3e5cdf035bdd1e0c28ea54a15fc158d99ece1ac51ee6d81dba8a0f5efc88ab0e","observation_id":"697b9dc7-4c81-4042-ba30-c4b59b5cdca8","resolution":{"observed_at":"2026-08-06T17:09:09.232452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.825091Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild,","venue":null,"work_id":"5848c4ab-05d2-4f4c-a34f-ef4ce28588c8","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.819097Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:f3affe3b9ab64fafec242b5a13379dbe34e021731289fcf1b6f198c8e0344dba","observation_id":"7b370099-2a7c-449f-acc8-6c8f058cd5f8","resolution":{"observed_at":"2026-08-06T17:09:08.923395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.562524Z","title":"Ferv39k: A large-scale multi-scene dataset for facial expres- sion recognition in videos,","venue":null,"work_id":"91f82899-fbf2-4a7c-903b-f5185df692e7","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.985284Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a5ccaff3f0b7a4f154adf8a46926c362b367b844c4a7e89db2a3c366ebee8edb","observation_id":"bbf98089-a486-4f67-9f52-4f89fe49eff0","resolution":{"observed_at":"2026-08-06T17:09:08.691148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.434815Z","title":"Dep-fer: Facial expression recognition in depressed patients based on voluntary facial expression mimicry,","venue":null,"work_id":"125d055b-babc-465d-aeb5-8622b306681e","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.172639Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6c5f24db1aca52534123b07b8c281efad9a4fb023e2156d31e8d2ebd740a18bd","observation_id":"154984c9-e876-47c2-84ae-4d67398609e4","resolution":{"observed_at":"2026-08-06T17:09:08.492490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.297262Z","title":"Efficient facial expression recognition with representation reinforcement network and transfer self-training for human–machine interaction,","venue":null,"work_id":"3f60aa4a-dcec-4617-a8c0-58fdd0dad0e2","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.384854Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:0aa303b208ef7750755186d0d19fc7bb8ea6a8f40e8be3e3e15a69382309e2db","observation_id":"770416af-30bd-44e0-ab48-7554f99f46f0","resolution":{"observed_at":"2026-08-06T17:09:08.367493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.159458Z","title":"Predicting personal- ized image emotion perceptions in social networks,","venue":null,"work_id":"dacda61a-4608-4589-b33c-a98462d93c74","year":2016},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.553598Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:67d6afb8b38dcbda74ee48474a5eb2b0481723bb2a482c84fe427c6871de8e10","observation_id":"afccfec2-b81d-41ca-baa9-d4b7a9b331e4","resolution":{"observed_at":"2026-08-06T17:09:08.225797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.985420Z","title":"Spatio-temporal convolutional features with nested lstm for facial expression recognition,","venue":null,"work_id":"30ae8790-f795-43b9-aaeb-f7bdd28799e0","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.726269Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:05d0d168371f9dfa7b3ae4e85a2e6ae5c9730c85ca90540376d09cde0bf227ef","observation_id":"8e3d8a74-1cb2-45fd-9683-5afaff8dc945","resolution":{"observed_at":"2026-08-06T17:09:08.056382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:50.885960Z","title":"Saanet: Siamese action-units attention network for improving dynamic facial expression recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.885960Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:e272128bac1e5a6501fc7c1179f3ef6671d4bc3496c4b5017fbfa3d1f2e79100","observation_id":"5639bf19-85ab-4294-8870-a9829cdffe31","resolution":{"observed_at":"2026-08-06T17:08:50.885960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:51.446133Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.446133Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:80e00e48097a0047b8ffec77ff5dedb0804a5a52e042cae864aeeca9059d6a60","observation_id":"9fe8fd94-4f81-4457-8460-8a451088566b","resolution":{"observed_at":"2026-08-06T17:08:51.446133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.792643Z","title":"Former-dfer: Dynamic facial expression recog- nition transformer,","venue":null,"work_id":"77d84b96-ca8b-4cf1-95c1-0fd9efbf4d50","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.579156Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:68db38fca095ba851cf2a1b7fa94ba36eb36f10d2a0d63d82fc2355ece9d30cf","observation_id":"76ef193a-40c2-48a4-8ada-3bf341c47643","resolution":{"observed_at":"2026-08-06T17:09:07.867624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:51.756681Z","title":"Ex- pression snippet transformer for robust video-based facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.756681Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:01f4efe33734e53e42ccce9a1cf6034906ca01c4a45c62319d3460c8baca1cfe","observation_id":"80ec1c43-07f3-4a26-b909-4f2dc26d0eb7","resolution":{"observed_at":"2026-08-06T17:08:51.756681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:52.037086Z","title":"Freq-hd: An interpretable frequency-based high-dynamics affective clip selection method for in-the-wild facial expression recognition in videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.037086Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:14d61383f063399303407481d8bda2fafc393044824fba405c100e7a71b8c271","observation_id":"0b439d16-a4e4-443e-8a0d-f2d8140ab652","resolution":{"observed_at":"2026-08-06T17:08:52.037086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.610794Z","title":"Facial expression recognition with adaptive frame rate based on multiple testing correction,","venue":null,"work_id":"fd124ee4-8ea4-4308-81a2-1f6586318764","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.159837Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:4212bac7ac2e171482dfaa5fbcef0767c911a010b0d4d50fa464639fd4f348ea","observation_id":"18c7a973-d1b5-4155-985c-bc9ab4855e05","resolution":{"observed_at":"2026-08-06T17:09:07.651357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.334722Z","title":"Video-based facial micro-expression analysis: A survey of datasets, features and algorithms,","venue":null,"work_id":"e22c6041-7de7-4f0c-aa83-bc649df51e11","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.268113Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:36ece1365357646f68ca5e7ab14c5ef523b4e13a41af28d6fe8c6ddbab70c775","observation_id":"a028bf9e-5a31-4acf-b5d9-cbfd4792e5d4","resolution":{"observed_at":"2026-08-06T17:09:07.455501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.021471Z","title":"Dynamic facial expression recognition under partial occlusion with optical flow reconstruction,","venue":null,"work_id":"f42a7442-283b-4a3e-b1ed-42f3484c7e6f","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.428689Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:01d55da932d9f9221d2d243c733a0a10b9b139b487870654a0dbb50cff581b0d","observation_id":"7fd07951-24e8-4737-90d0-a71bd023e60d","resolution":{"observed_at":"2026-08-06T17:09:07.145228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.417541Z","title":"From static to dynamic: Adapting landmark-aware image models for facial expression recognition in videos,","venue":null,"work_id":"2dc7cc8d-4d55-4e2b-a426-cfc0fa9af334","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.667666Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:cf4706da9dd653c734e01dd410c3ae1430caa03bcebbdd03ff64d9e6a48b0dd3","observation_id":"c2d87dcf-a356-49e0-8c39-70c1a6bfed9d","resolution":{"observed_at":"2026-08-06T17:09:06.532422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15777","last_updated":"2024-08-28T13:15:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:15:25Z","title":"A Survey on Facial Expression Recognition of Static and Dynamic Emotions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15777","snapshot_observed_at":"2026-08-06T17:08:52.781534Z","title":"A survey on facial expression recognition of static and dynamic emotions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.781534Z"},"links":{"cited_paper":"/paper/2408.15777","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:806a9bd3590ad15e28fce08b3f01f72ca21b275f568ead6e4308ba13c4ffc5dd","observation_id":"e9feacc7-04c8-4699-b675-a01cc7560e19","resolution":{"observed_at":"2026-08-06T17:08:52.781534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13382","last_updated":"2024-11-26T16:37:36Z","snapshot_observed_at":"2026-08-04T05:25:47.547926Z","submitted_at":"2023-08-25T13:52:05Z","title":"Prompting Visual-Language Models for Dynamic Facial Expression Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13382","snapshot_observed_at":"2026-08-06T17:08:52.937811Z","title":"Prompting visual-language models for dynamic facial expression recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.937811Z"},"links":{"cited_paper":"/paper/2308.13382","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:5ce1b851260f811a4babda46fcd541e056dbaeb0c8de8ad4ac739ae7b370de43","observation_id":"0e0c819f-6ba6-426b-852d-26ab597a8c06","resolution":{"observed_at":"2026-08-06T17:08:52.937811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.103865Z","title":"Emoclip: A vision-language method for zero-shot video facial expression recognition,","venue":null,"work_id":"fab9f89e-4cdf-4580-b043-4cf0a58b3f82","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.030094Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:77110f17196db1a0ae4a1a6d1af0c5ef57eb9d73e948d4a896fdd656352289ab","observation_id":"4e4d0b94-72eb-4c57-bbbd-9f175b5202df","resolution":{"observed_at":"2026-08-06T17:09:06.252373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.36817","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:59.769486Z","title":"Domain knowledge enhanced vision-language pretrained model for dynamic facial expression recognition,","venue":null,"work_id":"d532be21-e17d-456e-9bd6-affaa7615a6d","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.192045Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:93d6dd7f99bb69ac4b9108ecd0f7f379f6a9dff4fd6f71b02dfbae77c13d3194","observation_id":"964eea29-3d44-4c2b-b79f-40a7c4518bee","resolution":{"observed_at":"2026-08-06T17:08:59.856215Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.813615Z","title":"Enhancing zero-shot facial expression recognition by llm knowledge transfer,","venue":null,"work_id":"6f7d8c5d-d685-489f-a2e0-46b5c2d7f389","year":2025},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.286611Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d4e7ffc5f9d52e1f8d77546fe948a8fdba2c8c04b252a9d36de452a81aca5b19","observation_id":"cfdaf705-c9c9-4083-b02b-5a5371ec2dfe","resolution":{"observed_at":"2026-08-06T17:09:05.963193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:53.456059Z","title":"Finecliper: Multi-modal fine-grained clip for dynamic facial expression recognition with adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.456059Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6ec128a74386db78969726811cf1b2bbd27790a378b6f8be1c86171b29adddfd","observation_id":"65ef274e-e86c-4c71-a2ac-6d5b54a12094","resolution":{"observed_at":"2026-08-06T17:08:53.456059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.462331Z","title":"Describe your facial expressions by linking image encoders and large language models","venue":null,"work_id":"b95b19d1-8eac-4fb8-815a-05c333c590a7","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.642988Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6def0996f5892b193695cb4ab49d556e078d2fe97cbdf38cbc296e51d9d9b0fa","observation_id":"1013a341-58d0-45a2-ba81-9eef0ddfdd18","resolution":{"observed_at":"2026-08-06T17:09:05.528965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:53.771017Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.771017Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:7b13c65c47176c06410d9b70c4f2a954153adf2e63f3c2f975a1a6f43128d668","observation_id":"4efb4a3a-9c7f-49e8-8ad4-233405174190","resolution":{"observed_at":"2026-08-06T17:08:53.771017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13164","last_updated":"2019-05-30T16:49:11Z","snapshot_observed_at":"2026-08-07T07:47:18.837069Z","submitted_at":"2019-05-30T16:49:11Z","title":"Hierarchical Transformers for Multi-Document Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13164","snapshot_observed_at":"2026-08-06T17:08:53.883130Z","title":"Hierarchical transformers for multi-document summarization,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.883130Z"},"links":{"cited_paper":"/paper/1905.13164","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d4118df684cca6a669ffdeeb233ee6514f7e57776584adc18fca8b5bc4fdd846","observation_id":"acbe33dc-ae8f-43e1-a5a4-b2d18cd43e08","resolution":{"observed_at":"2026-08-06T17:08:53.883130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08330","last_updated":"2024-07-11T09:28:04Z","snapshot_observed_at":"2026-08-03T19:52:23.327084Z","submitted_at":"2024-07-11T09:28:04Z","title":"HDT: Hierarchical Document Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08330","snapshot_observed_at":"2026-08-06T17:08:53.989568Z","title":"Hdt: Hierarchical document transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.989568Z"},"links":{"cited_paper":"/paper/2407.08330","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:85240467b458a35ac8be04fb7a524e2b0b4cecb201e4dc8c7779baf5da06dc1e","observation_id":"725a3fc7-35fd-49bc-ac14-a37a4d0e6b46","resolution":{"observed_at":"2026-08-06T17:08:53.989568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.269835Z","title":"Multi-task learning of hierarchical vision-language representation,","venue":null,"work_id":"db1cc455-6e45-472e-8eb6-09cd3c9fdde7","year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.100810Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:77fe40aa804f946acd6e991e4ecbdfaaff8f897933b0bcfeac1e7bf8d7f908a0","observation_id":"ce50ff7e-9644-4481-b55c-2d587c8e3144","resolution":{"observed_at":"2026-08-06T17:09:05.349116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-04T07:19:10.375553Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-06T17:08:54.214011Z","title":"Hero: Hier- archical encoder for video+ language omni-representation pre-training,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.214011Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:92469fdf5aa848dcd4dee17a34f50fc6869220a009f80507d096a8015556d5bc","observation_id":"0ca66b65-6b30-4633-b844-1cc8f35be18f","resolution":{"observed_at":"2026-08-06T17:08:54.214011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.055848Z","title":"Hierarchical modular network for video captioning,","venue":null,"work_id":"f911630e-0266-4938-b184-099002ad9e41","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.323924Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2784d93a84cab06c06d333100927666f1163980a6922a7013c34f0355b51bd07","observation_id":"242d3e97-996a-4f4f-86b9-67bcf9fb00d2","resolution":{"observed_at":"2026-08-06T17:09:05.135439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:54.486076Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.486076Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6a6fa55764c9d0bb34ca11f6aa77c9f3e360ebaf144a1ad913cd48f6941797b8","observation_id":"cb83ea55-fd32-41b7-87bb-c41d4f594515","resolution":{"observed_at":"2026-08-06T17:08:54.486076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.599642Z","title":"Ceprompt: Cross-modal emotion-aware prompting for facial expression recognition,","venue":null,"work_id":"f8593630-c911-4b27-9f80-b66d4ea8acd2","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.620430Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:4ae64543cda39b1bf4d56525e7b356bd8d399c84be4d465a198837f0a53fe2c0","observation_id":"190d69ec-35eb-46a9-8f1f-3895e2b534c9","resolution":{"observed_at":"2026-08-06T17:09:05.672039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.752313Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"cd393155-f26d-4aba-baef-105a5e3056f4","year":2013},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.819539Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:78da25c83ad4e3ded907ad1b3f104e5aeb0c998d74a5942653ecb85ad845b796","observation_id":"06cef10d-69f3-47cb-a657-62d3cab51910","resolution":{"observed_at":"2026-08-06T17:09:04.917377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.476707Z","title":"Recent advances in optimal transport for machine learning,","venue":null,"work_id":"3db7c659-bcfd-42c9-88aa-23d9f449a36c","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.948095Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a5b05d4f095c4f54ce63825cbffebacdc36578aa3d83cc8212764a00555b9064","observation_id":"5110dfd2-d14c-4c5c-9502-d00fe488b898","resolution":{"observed_at":"2026-08-06T17:09:04.570793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:55.068589Z","title":"Reliable weighted optimal transport for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.068589Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:39a8e9651cce1b43266a2ae56cc8a2e5993857a503b35a96282fa23e62980bef","observation_id":"7cb898f7-e789-4677-a77b-f6aee9e2dcfe","resolution":{"observed_at":"2026-08-06T17:08:55.068589Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.200755Z","title":"Unsupervised learning of visual features by contrasting cluster as- signments,","venue":null,"work_id":"e038d87d-9f6c-4f6f-8af6-032b6877d672","year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.184879Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:51404c7cf0226c5c23d480806df38afb349b02cb5edc00b460bb6697bf78152e","observation_id":"ff886e30-8ed9-46c3-8ff7-4223c9bcf03d","resolution":{"observed_at":"2026-08-06T17:09:04.349557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.950270Z","title":"Optimal partial transport based sentence selection for long-form document matching,","venue":null,"work_id":"304e619c-c414-40c2-804c-5b7806476bc4","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.298606Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:e93662d42e0155ef5e39964059d9436f28c1ddbd022b1af7de8b328d1cd14294","observation_id":"8550292e-d670-4762-98d3-edd840d6d036","resolution":{"observed_at":"2026-08-06T17:09:04.049201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.739825Z","title":"Learning to align sequential actions in the wild,","venue":null,"work_id":"86cab831-61d7-47df-8f45-dca543e0912c","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.446654Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:f67d57ac20a3148677ac4f8132869fbbc5ef0ce8af8eb48b1ae8624a12b53985","observation_id":"ee3bd80c-b722-45b9-8bfb-73909537e983","resolution":{"observed_at":"2026-08-06T17:09:03.796463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.470019Z","title":"What when and where? self-supervised spatio-temporal grounding in untrimmed multi-action videos from narrated instructions,","venue":null,"work_id":"76dbec48-84d0-426e-a38e-f5700d879438","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.583412Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:0798af3e225832be89ec696db2d865a84f05c79df2b587664d53592b3dab5610","observation_id":"55dcb424-4071-4d6f-abbd-814214ae3886","resolution":{"observed_at":"2026-08-06T17:09:03.611461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16702","last_updated":"2024-01-30T03:03:26Z","snapshot_observed_at":"2026-07-06T17:22:15.248410Z","submitted_at":"2024-01-30T03:03:26Z","title":"Multi-granularity Correspondence Learning from Long-term Noisy Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16702","snapshot_observed_at":"2026-08-06T17:08:55.704482Z","title":"Multi- granularity correspondence learning from long-term noisy videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.704482Z"},"links":{"cited_paper":"/paper/2401.16702","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:49ed2f71a3b0f946abfa6c9be036b8813135ef60c10452f98649ba0192e3d600","observation_id":"a0a922a5-baee-4e19-869d-6cc760f1c08f","resolution":{"observed_at":"2026-08-06T17:08:55.704482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.701985Z","title":"Spatial- temporal graphs plus transformers for geometry-guided facial expression recognition,","venue":null,"work_id":"e6df5afd-ce6b-4bce-8644-4421f0ca9ffd","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.829988Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:db5b6d5f2b629f0f716eb002ac8703a463844eacc6cabaad094c80e55054f333","observation_id":"3acb2635-48d1-4bd5-8d6f-82a43a92f8d2","resolution":{"observed_at":"2026-08-06T17:09:06.842125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.876675Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":"fe7d5e0a-b4ab-4e83-8203-3646b1176c35","year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.109359Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:38335e300b1f279cc0b77acb0b911d4a8b570e32453a6a7ab6c79a7c56e863fe","observation_id":"22258bd3-e252-4538-b727-1377306c1864","resolution":{"observed_at":"2026-08-06T17:09:02.956146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.248682Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.248682Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a12cf8fe9c4c19c5d44fc15e5876d95a1ef3346aaec4b5a4d5d8a6d71bb39499","observation_id":"e3b68206-aaa7-440c-8809-87610c2582a6","resolution":{"observed_at":"2026-08-06T17:08:56.248682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.385574Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.385574Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:248d1f634455af2a9ed3a60447f6af1ddbc8a8e71362cb8e0fa9b9ff707e7c06","observation_id":"adc6628f-859d-410f-b0bc-9ed5bdce20f6","resolution":{"observed_at":"2026-08-06T17:08:56.385574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.557720Z","title":"Cliper: A unified vision-language framework for in-the-wild facial expression recognition,","venue":null,"work_id":"c09ace6a-9731-45f3-b603-d5937206aefc","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.546603Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:026c0c3a97665371608ecadaec8ad73afcf9d69ce07825906b1bd2c49b617cf3","observation_id":"91adfa9d-5d95-413a-b0dc-543745217bdc","resolution":{"observed_at":"2026-08-06T17:09:02.695424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:08:56.717302Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.717302Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:1bbd5550c3b1a2adff52c9e3479694dc4220dcc624295b6b9614ff2c0532cc4b","observation_id":"a771a906-1941-46cd-9384-d776e716758d","resolution":{"observed_at":"2026-08-06T17:08:56.717302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.854748Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.854748Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:1300e9efa5e950e9216a9f5d0bd891af7753977cd4cf9e8950a0842e0882b8cc","observation_id":"2ef3652f-b4ba-4a6a-9be8-6020b5bdcb3b","resolution":{"observed_at":"2026-08-06T17:08:56.854748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T17:08:56.989600Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.989600Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:8e23d950d05c67bd1dbcb0ab1e3572279317cce0f7dfc393f1309af374b2f9e3","observation_id":"0ff0bbb6-eb8a-41d8-ba58-e1eb879b040d","resolution":{"observed_at":"2026-08-06T17:08:56.989600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:57.095778Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.095778Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:7e7330a856bca2dd6c8925f1e87e886d86ac777689ff557133ee774626860af2","observation_id":"d7fdddc8-f420-4089-a31d-40ca86630da1","resolution":{"observed_at":"2026-08-06T17:08:57.095778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:57.212905Z","title":"Mae-dfer: Efficient masked autoencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.212905Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6cdab770ff21377bd3c500a6540b0e75ca14b998b52909d4dcf07fbcb7e149f5","observation_id":"c0f13447-3841-4612-bf12-eab2e9546562","resolution":{"observed_at":"2026-08-06T17:08:57.212905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.261483Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- 14 tioning,","venue":null,"work_id":"347a8581-146b-4837-b63e-8510aa46c5ac","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.346343Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:5ae40bdd9edc406aa3217a4e53cacc84b893523cfbccfb8178d2c35195d26fe6","observation_id":"40c53bc4-6176-455b-b879-1db2e02025b8","resolution":{"observed_at":"2026-08-06T17:09:02.372262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.033614Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"6fbaa970-740b-4111-9acc-511991610a72","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.491789Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:76fa50a1988eb54379c8d1b6ea2fcf72afe1afd35f9db217a8429b4a4aff803b","observation_id":"0d0349cd-faf4-4122-9945-7563471fbdbb","resolution":{"observed_at":"2026-08-06T17:09:02.133934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.760917Z","title":"Emotion recognition using imperfect speech recognition,","venue":null,"work_id":"456c1527-2179-4fc1-9734-273fab89fc5a","year":2010},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.635608Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:7619d366a1a5c8dffe7fb803cd90e099171570f61660a564925704269d1a6538","observation_id":"c3208862-0942-423d-9cbc-8b85e139500c","resolution":{"observed_at":"2026-08-06T17:09:01.900774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.465912Z","title":"Posterior calibration for multi- class paralinguistic classification,","venue":null,"work_id":"577867cd-a030-4186-ae21-661201e4c04f","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.805680Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:b5b914c55f0d48fa1019954d1295e7b95388c96d0e19fc855351e53f0d455c77","observation_id":"0edd08c9-2483-4ae2-b727-2e19eecae091","resolution":{"observed_at":"2026-08-06T17:09:01.577572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.184757Z","title":"Rethinking the learning paradigm for dynamic facial expression recog- nition,","venue":null,"work_id":"d75cc614-0e90-4621-9653-942254b713fe","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.917571Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a4127eec705e328ded64f95b0a51475c5408c94957ebb3e9729b08054218fc3b","observation_id":"b06a9716-7b97-40fa-a894-d07f957a2a4c","resolution":{"observed_at":"2026-08-06T17:09:01.317518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04294","last_updated":"2024-03-07T07:43:04Z","snapshot_observed_at":"2026-08-07T06:14:58.076860Z","submitted_at":"2024-03-07T07:43:04Z","title":"A$^{3}$lign-DFER: Pioneering Comprehensive Dynamic Affective Alignment for Dynamic Facial Expression Recognition with CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04294","snapshot_observed_at":"2026-08-06T17:08:58.053197Z","title":"A ˆ3 lign-dfer: Pioneering comprehensive dynamic affective alignment for dynamic facial expression recognition with clip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.053197Z"},"links":{"cited_paper":"/paper/2403.04294","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:bd0fdf0dbdfb4e2265cccbd08aeafbaed5be464b0bc04854c4c104a93c67c066","observation_id":"e9fc0632-63cf-4362-9066-95f90e68fbd1","resolution":{"observed_at":"2026-08-06T17:08:58.053197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.852550Z","title":"Clip-aware expressive feature learning for video-based facial expression recognition,","venue":null,"work_id":"ef09cd89-eae9-485c-89fc-209aebb1a89f","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.167769Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:8e81c5fa1ad48a7cd340534709a8bdea296f24a60f06924233ed2ac1d46f23fa","observation_id":"bb674402-af34-407a-86c6-4a7b01908490","resolution":{"observed_at":"2026-08-06T17:09:01.028233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04975","last_updated":"2022-06-10T10:17:30Z","snapshot_observed_at":"2026-07-06T13:19:26.611207Z","submitted_at":"2022-06-10T10:17:30Z","title":"NR-DFERNet: Noise-Robust Network for Dynamic Facial Expression Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04975","snapshot_observed_at":"2026-08-06T17:08:58.322047Z","title":"Nr-dfernet: Noise-robust network for dy- namic facial expression recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.322047Z"},"links":{"cited_paper":"/paper/2206.04975","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:e512129d9ff0e5c17f4429d47e1640de6b3536ba9d2656135d680a9a1ef6f4bf","observation_id":"5c53bea4-72b1-4926-8ec7-ed45a3ceb9b8","resolution":{"observed_at":"2026-08-06T17:08:58.322047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:58.457153Z","title":"Logo-former: Local-global spatio-temporal transformer for dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.457153Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:7b3b2cddf4384ec391aa278852aad7669f96408cb62cae296f91e8d438b7447a","observation_id":"c01291c4-fcdc-4459-8ccd-dd3fbabce61f","resolution":{"observed_at":"2026-08-06T17:08:58.457153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.115305Z","title":"Intensity-aware loss for dynamic facial expression recognition in the wild,","venue":null,"work_id":"d182b8ad-845c-4a8b-a38d-b1ff489fb5b5","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.592846Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2fe9669151c40b94223c9a4241dbcf140cfc967c49d5179538e12a5fe8e51faa","observation_id":"025acfcc-723b-4024-9ea7-4130c4153e70","resolution":{"observed_at":"2026-08-06T17:09:03.269880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.605082Z","title":"Transformer-based multimodal emotional perception for dynamic facial expression recogni- tion in the wild,","venue":null,"work_id":"4bc21782-3185-484c-b440-261e771ed768","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.705759Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:00f9adcc930d184b5d1e9ba66231ae5cec59782df8ed23f9a04f23800eb3fa13","observation_id":"44e6292c-dc8c-490b-8ef8-c2126613213e","resolution":{"observed_at":"2026-08-06T17:09:00.714047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.369172Z","title":"Svfap: Self-supervised video facial affect perceiver,","venue":null,"work_id":"46ce44b7-5cbb-4441-bf7b-62482b44af86","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.844014Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:4178c90a44fae97cc034e2ce91a397f2e4e2dce69f370cd791554c36b7e596b2","observation_id":"6d6c81c3-f280-4671-9ef9-d9f219746c94","resolution":{"observed_at":"2026-08-06T17:09:00.483481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.175909Z","title":"Hicmae: Hierarchical contrastive masked autoencoder for self-supervised audio-visual emotion recogni- tion,","venue":null,"work_id":"595471e3-493d-4a9b-a65f-cd3c1655e2bb","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.980743Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:684194a1182f6e19324927604ffe76279c7959708942ac144a45c4c02a554d24","observation_id":"56f4fb15-b13d-4326-8e4b-6bd0070b72bd","resolution":{"observed_at":"2026-08-06T17:09:00.250849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:47:52.036624Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2507.11892."}