{"as_of":"2026-08-07T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f7b470dbbb7497a473d3958aaab32780e67a1c449b387c6aa0f33ff61946230","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:44:21.971254Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02080/citation-record","integrity":"/paper/2507.02080/integrity","json":"/paper/2507.02080/citation-record.json","paper":"/paper/2507.02080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:18.155528Z","title":"Maven: Multi-modal attention for valence-arousal emotion network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.155528Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:d665e1e23d520e82a1dc79cdb4ef6e9da9cf2b81e249896f1e6cc64082c493d3","observation_id":"adb0f36b-664d-4e1b-aa97-d19928e0cf55","resolution":{"observed_at":"2026-08-06T20:44:18.155528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.644660Z","title":"Gated multimodal networks","venue":null,"work_id":"5baea0ad-7412-40d5-93e5-2b5b295db13b","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.206339Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:ffa42225dbc3c46770b655fa2125f89fbbc52728671b970a966092ccbf64e14b","observation_id":"8a15a724-ae5f-498f-8496-2820847ba743","resolution":{"observed_at":"2026-08-06T20:44:22.647964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.632909Z","title":"Valence focus and arousal focus: Individual differences in the structure of affective experience","venue":null,"work_id":"f9755b27-06c7-4058-b17f-6133785e0cc1","year":1995},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.293003Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:ba35f3df5a4f63c512c17b9108e55d3c2900f71c239b0358ecad20932357459e","observation_id":"54282bae-b66e-45ec-8a40-004fa50bad6f","resolution":{"observed_at":"2026-08-06T20:44:22.636828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.622249Z","title":"Joint modelling of audio-visual cues using attention mechanisms for emotion recognition","venue":null,"work_id":"c26773fd-d332-40bf-80a5-c57a33538122","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.364205Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:08e17fc806673f36b112fc0ce36c6191b7cf5d6d66cd82f00e029707b6a2bba3","observation_id":"9af34998-835e-45d6-a2a3-23e6dc66d339","resolution":{"observed_at":"2026-08-06T20:44:22.625857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.610701Z","title":"Ms-celeb-1m: A dataset and benchmark for large-scale face recognition","venue":null,"work_id":"5842007b-81ec-402b-a3e4-4bd4347f0a41","year":2016},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.462272Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:7c7949bcd20dce64a7e97c37e5dc4017d9925075365d41e7bdd15254eb0d1db2","observation_id":"2154ffd1-55c6-42a1-ad43-85a25ca49232","resolution":{"observed_at":"2026-08-06T20:44:22.614427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:18.519772Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.519772Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:8e19c769ab04713330949f4e72e31f4a2f20225b22e0575a91444c5c223126d9","observation_id":"3ed6848f-edaf-46f0-93af-775fd11c7079","resolution":{"observed_at":"2026-08-06T20:44:18.519772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.591687Z","title":"Deep learning-based approach for con- tinuous affect prediction from facial expression images in valence-arousal space","venue":null,"work_id":"e40f43f0-14fd-49d4-a0bc-6fa3b56413b0","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.617096Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:2e05ce0f6199101f632ff8d40884fe49c6ad360f89f679749fab54eb9dd534ba","observation_id":"dc2487bc-d498-4755-969f-efdc8c82796a","resolution":{"observed_at":"2026-08-06T20:44:22.596362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13285","last_updated":"2022-03-29T16:02:46Z","snapshot_observed_at":"2026-07-06T12:52:09.145702Z","submitted_at":"2022-03-24T18:22:56Z","title":"Continuous-Time Audiovisual Fusion with Recurrence vs. Attention for In-The-Wild Affect Recognition","version":2},"cited_work":{"arxiv_id":"2203.13285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.13285","snapshot_observed_at":"2026-08-06T20:44:22.104836Z","title":"Continuous-Time Audiovisual Fusion with Recurrence vs. Attention for In-The-Wild Affect Recognition","venue":"cs.SD","work_id":"7c36352a-311d-489c-9cb4-edfa4cae4792","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.687924Z"},"links":{"cited_paper":"/paper/2203.13285","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:a06aa28f316d04c1342b2830b0ad47822831b173bf6ca60fd33394d844f3650f","observation_id":"772f1660-88d3-4d0a-8662-1b7e01aa23d4","resolution":{"observed_at":"2026-08-06T20:44:22.111595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.580070Z","title":"Abaw: Valence-arousal estimation, ex- pression recognition, action unit detection & multi-task learning challenges","venue":null,"work_id":"3cc1cd4e-7132-431a-9cb1-6b9373ba99a1","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.762242Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:8cbbf893f807429c24cdd04f5f3fdaa3ca5036f621d37414acff351d850f5dbc","observation_id":"321eb557-9b8f-42b1-a036-2a0eaae561a2","resolution":{"observed_at":"2026-08-06T20:44:22.584193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.568951Z","title":"Abaw: Learning from synthetic data & multi-task learning challenges","venue":null,"work_id":"7fe18c0e-5e50-436f-8260-e9d77e3c4874","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.822994Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:2e8304d1f8207df3f116661515f1f365cfc73c29e798ee6516e7007db3db6768","observation_id":"31427eb2-ac68-4115-8700-a5969f13774d","resolution":{"observed_at":"2026-08-06T20:44:22.573098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.557505Z","title":"Multi-label compound expression recog- nition: C-expr database & network","venue":null,"work_id":"8274c6d8-69a7-436f-9020-8d698bbfdc93","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.911471Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:1f52f00c2d5393fc5aa3da361355c7b60ec76d3d2ceba4ff6e45cba7de510cd9","observation_id":"ec734efa-6dcc-451d-8ff7-1344a518e0bc","resolution":{"observed_at":"2026-08-06T20:44:22.561232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04855","last_updated":"2019-09-25T22:45:18Z","snapshot_observed_at":"2026-07-06T08:28:35.109400Z","submitted_at":"2019-09-25T22:45:18Z","title":"Expression, Affect, Action Unit Recognition: Aff-Wild2, Multi-Task Learning and ArcFace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04855","snapshot_observed_at":"2026-08-06T20:44:18.955974Z","title":"Expression, affect, action unit recognition: Aff-wild2, multi-task learning and arcface","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.955974Z"},"links":{"cited_paper":"/paper/1910.04855","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:fc6732a3d18cc40af2679e72db77281325a21cac3f6db0974364574816ee9bf6","observation_id":"d35e1e0e-928b-473f-b131-0c09725a0a65","resolution":{"observed_at":"2026-08-06T20:44:18.955974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15792","last_updated":"2021-03-29T17:36:20Z","snapshot_observed_at":"2026-07-06T10:54:32.865841Z","submitted_at":"2021-03-29T17:36:20Z","title":"Affect Analysis in-the-wild: Valence-Arousal, Expressions, Action Units and a Unified Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15792","snapshot_observed_at":"2026-08-06T20:44:18.977500Z","title":"Affect analysis in-the-wild: Valence-arousal, expressions, action units and a unified framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.977500Z"},"links":{"cited_paper":"/paper/2103.15792","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:c041f5bea0f672174f582807be3d7030a881a77088b1d1839d611ca7d2081bd0","observation_id":"1416043f-2f79-47a2-8c63-591df5a5ba4f","resolution":{"observed_at":"2026-08-06T20:44:18.977500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.545802Z","title":"Analysing affec- tive behavior in the second abaw2 competition","venue":null,"work_id":"c1cae452-6d27-4c18-9e3f-1f49cfaefa47","year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.023351Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:7f9b0e069aa0f6ec45a75b81b36644a046f534826d39a615ac78b908a08bd842","observation_id":"8038ab7f-ad45-464e-943a-f42dc222a415","resolution":{"observed_at":"2026-08-06T20:44:22.549475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.534362Z","title":"Analysing affective behavior in the first abaw 2020 competition","venue":null,"work_id":"ae255c9d-f649-4594-a1a5-9cd91ae00639","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.062969Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:399501f1fafde452a34d18acdb3a873a23e3881b94bbf917c0eb485b2447702e","observation_id":"48ae7f90-e52a-422a-9f39-48cba4b9eadb","resolution":{"observed_at":"2026-08-06T20:44:22.538337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11111","last_updated":"2020-05-29T02:35:49Z","snapshot_observed_at":"2026-07-06T08:31:56.527124Z","submitted_at":"2019-10-15T15:45:41Z","title":"Face Behavior a la carte: Expressions, Affect and Action Units in a Single Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11111","snapshot_observed_at":"2026-08-06T20:44:19.102470Z","title":"Face behavior a la carte: Expressions, af- fect and action units in a single network","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.102470Z"},"links":{"cited_paper":"/paper/1910.11111","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:7c1782877cd236229ae89a2ed820ce5a6871d2d2564b617bd68dad7d4cb6a80f","observation_id":"fe4289f4-d6ab-4cf8-8f89-19999bc3477b","resolution":{"observed_at":"2026-08-06T20:44:19.102470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.523143Z","title":"Deep affect prediction in-the-wild: Aff-wild database and challenge, deep architec- tures, and beyond","venue":null,"work_id":"7de3fa3d-b689-40bf-8764-4bb917311cb0","year":2019},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.163243Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:49eba59d65774c1723c04b3148f6ea81235f6bd12af280ce7b377beb0bdd72a3","observation_id":"527f2aa2-f99a-4b3e-832a-562f14d863e6","resolution":{"observed_at":"2026-08-06T20:44:22.526876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03790","last_updated":"2021-05-08T22:26:52Z","snapshot_observed_at":"2026-07-06T11:07:34.876977Z","submitted_at":"2021-05-08T22:26:52Z","title":"Distribution Matching for Heterogeneous Multi-Task Learning: a Large-scale Face Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03790","snapshot_observed_at":"2026-08-06T20:44:19.216546Z","title":"Distribution matching for heterogeneous multi- task learning: a large-scale face study","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.216546Z"},"links":{"cited_paper":"/paper/2105.03790","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:36ca2e7c565d6971db417307a572fad9660011609a5bcbbfd5d0851a6ec04476","observation_id":"99ea2612-1655-43aa-bc73-80baf97278f0","resolution":{"observed_at":"2026-08-06T20:44:19.216546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.511373Z","title":"Abaw: Valence-arousal esti- mation, expression recognition, action unit detection & emo- tional reaction intensity estimation challenges","venue":null,"work_id":"7551f908-b6ac-4990-a66c-1960c0f79a2f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.271625Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:31b5c302d22a852b781449156e19ca9f3f9375c25e8bfa1c0cba2b110ad5bf4c","observation_id":"f95d004e-0214-4d5c-87e0-161a092088ad","resolution":{"observed_at":"2026-08-06T20:44:22.515640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.498711Z","title":"Distribution matching for multi-task learning of classification tasks: a large-scale study on faces & beyond","venue":null,"work_id":"328a0f9a-9517-4b9a-8333-b6a8773477d4","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.350788Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:35729990f3d6fe4b1abc65e416b5d3a611b86bafe789224e5037960f543ad399","observation_id":"a7cdfd12-b52b-4172-b165-aee9ec26c987","resolution":{"observed_at":"2026-08-06T20:44:22.503125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.485721Z","title":"The 6th affective behav- ior analysis in-the-wild (abaw) competition","venue":null,"work_id":"73f2fb55-5118-49b1-89a2-efc27d10cdcf","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.395305Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:d3e3fc77a41215df190873488a9a4f853cd5e832ea96cff474a3f329b3f0a204","observation_id":"0f8bbc7b-c0c6-4915-a7ce-40ae2a629447","resolution":{"observed_at":"2026-08-06T20:44:22.490707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03835","last_updated":"2024-07-08T10:40:53Z","snapshot_observed_at":"2026-07-06T18:41:27.621784Z","submitted_at":"2024-07-04T11:04:29Z","title":"7th ABAW Competition: Multi-Task Learning and Compound Expression Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03835","snapshot_observed_at":"2026-08-06T20:44:19.440218Z","title":"7th abaw competition: Multi-task learning and compound expression recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.440218Z"},"links":{"cited_paper":"/paper/2407.03835","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:fbb3ad61531c0c975936900018df5572aca579cc8bddf73e2f5f416bb21d6789","observation_id":"86e746f1-c41e-4851-a5e5-191d72c70b9d","resolution":{"observed_at":"2026-08-06T20:44:19.440218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05372","last_updated":"2025-05-29T01:27:33Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-05-29T01:27:33Z","title":"DVD: A Comprehensive Dataset for Advancing Violence Detection in Real-World Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05372","snapshot_observed_at":"2026-08-06T20:44:19.523313Z","title":"Dvd: A comprehensive dataset for advanc- ing violence detection in real-world scenarios.arXiv preprint arXiv:2506.05372, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.523313Z"},"links":{"cited_paper":"/paper/2506.05372","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:da9d070add098584c7a187ab666c5acb86d9894723d3e2dcb97a7f4f1dbc8bf6","observation_id":"ddafcc4c-10e6-4836-ad3c-b488f9ed466a","resolution":{"observed_at":"2026-08-06T20:44:19.523313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.473271Z","title":"Advancements in affective and behavior analysis: The 8th abaw workshop and competition","venue":null,"work_id":"52fbd717-46e6-4ff4-9764-06c7eea77e30","year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.586794Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:d22c75cb2736386c9d01454ffab8fbfb0ad8e0f1f2d2a7294e005c7f0cdaccdb","observation_id":"56fb3ec0-5a4d-4c34-8a43-bd6fa7dd6edd","resolution":{"observed_at":"2026-08-06T20:44:22.477889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.461212Z","title":"Gated mechanism for at- tention based multi modal sentiment analysis","venue":null,"work_id":"283b8ec6-044f-4ecd-9c0e-4fcb4ce0e331","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.634158Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:b3c9e4a1f4d2b1d07a3e14304d2d9a4abc5af63e177aad6992eb411af04a2470","observation_id":"bbc6667e-a2c7-46f9-930b-dfacd59c51ba","resolution":{"observed_at":"2026-08-06T20:44:22.465891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.450048Z","title":"Emotion, artificial intelligence, and ethics","venue":null,"work_id":"df80eabf-a5ac-412b-9cee-1a38a8300227","year":2015},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.679003Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:68af84904b78e39a6ee86785154dcbccb715e7aacf7901100937e54ed1a399c7","observation_id":"4e0b2da9-86be-48b4-89ec-1ba9907f2861","resolution":{"observed_at":"2026-08-06T20:44:22.453885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.439204Z","title":"Multi-modal fusion network with complementarity and importance for emotion recognition","venue":null,"work_id":"8f671ea2-cd0d-4310-b8c9-1221f200f964","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.709574Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9da392ccc9a2bad232b91f07979657133beeabf5b3fef703cf0befc2238c8112","observation_id":"1b9b5dba-8e12-4558-bbe2-6551eb179206","resolution":{"observed_at":"2026-08-06T20:44:22.443345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.428668Z","title":"Valence and arousal estimation based on multimodal temporal-aware features for videos in the wild","venue":null,"work_id":"681847a1-322c-462d-9b12-70c0ebdcd222","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.762417Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:39d762c6043cb834d749cd4254f836dc17405d5b2060f03a8806d6a7b8836427","observation_id":"ab4c25aa-e8a7-4371-8ae9-0be369e54e97","resolution":{"observed_at":"2026-08-06T20:44:22.432242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.417889Z","title":"United we stand: Emphasizing commonali- ties across cognitive-behavioral therapies","venue":null,"work_id":"d1e9c4b4-443b-4b4d-a77c-e267d69fddb7","year":2013},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.807937Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:ebbd7cb98685de7fe1e19d37694c185e5433d39c5c1c878905ea1770eafc9a41","observation_id":"4f2e5900-cbe4-4ddd-a9f9-6de6ba3ec325","resolution":{"observed_at":"2026-08-06T20:44:22.421560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.406887Z","title":"Cnn-lstm facial ex- pression recognition method fused with two-layer attention mechanism","venue":null,"work_id":"22f25bdc-8718-4b81-8aa6-5e5727e22c86","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.847887Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:19798dc342c255d55e216e5135630ee70e32391af3a7d172043636b492d1fa60","observation_id":"bd54f25a-9a22-4500-835e-012ab1827522","resolution":{"observed_at":"2026-08-06T20:44:22.410572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.395391Z","title":"Mul- timodal emotion recognition using cross modal audio-video fusion with attention and deep metric learning","venue":null,"work_id":"a2c8b4cd-812a-4cba-892f-ca99b3be2028","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.888780Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:43a79fdd70b3e671a060aa3fd6dcc0823df699fa2bb1c78065bafe04bb7b8ef7","observation_id":"b4c98aec-1ef2-4dc1-9daa-5ffbaecdcde5","resolution":{"observed_at":"2026-08-06T20:44:22.399920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.383585Z","title":"Cross-attention is not always needed: Dynamic cross-attention for audio-visual di- mensional emotion recognition","venue":null,"work_id":"69aebea9-a668-45c2-9f95-d128402e8953","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.951786Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:d4d3ea3cc558e0981b392089be6eb42dad5dd2fbe408fca78bcf80a2f6a6f815","observation_id":"68c6a5e7-b357-4a85-a392-afe472e92a4b","resolution":{"observed_at":"2026-08-06T20:44:22.388079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.371595Z","title":"Incongruity-aware cross-modal attention for audio-visual fusion in dimensional emotion recognition","venue":null,"work_id":"5c09cc23-21b6-4c5e-b19c-f45aa30646ea","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.989886Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:59123668f4f14b9086840d04aef748f05adc8e8f072556fef50cfdf012514d17","observation_id":"78aad30c-a53f-41fb-aeec-786c5f0a3edc","resolution":{"observed_at":"2026-08-06T20:44:22.376056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.357715Z","title":"Recursive joint cross- modal attention for multimodal fusion in dimensional emo- tion recognition","venue":null,"work_id":"ac905247-bb65-45e7-a354-708ccd8e4f70","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.042508Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:3b4233c03c97be7779a7cc49bd93a813a78fb69e54c31ea468b25db5037c8368","observation_id":"fc456000-efae-4ac2-8183-25063e1d43ff","resolution":{"observed_at":"2026-08-06T20:44:22.362720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.343915Z","title":"A joint cross-attention model for audio-visual fusion in dimensional emotion recognition","venue":null,"work_id":"b219a11a-4af3-4617-931d-56641cc68c0e","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.107155Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:f8e86cc120a1935bff84ddac987b40b29a3c1c4da9b9f804e6736540295a96e2","observation_id":"0704a91d-7057-429e-9e9d-ee7916c0345a","resolution":{"observed_at":"2026-08-06T20:44:22.348192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.331122Z","title":"Audio–visual fusion for emotion recognition in the valence– arousal space using joint cross-attention","venue":null,"work_id":"888f4289-bfd9-42d6-ad97-f44df2391836","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.144703Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:79a3e39edc984185848617daf8b50109bb38ce4b9c063e83396adab8790ed954","observation_id":"f294aa7b-f263-44b2-82fc-e77124ec60f3","resolution":{"observed_at":"2026-08-06T20:44:22.335756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.310407Z","title":"Re- cursive joint attention for audio-visual fusion in regression based emotion recognition","venue":null,"work_id":"1bcbf3cd-6228-4261-a5db-169b90dc4579","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.213618Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:2916bd408be546dd9acd6496e2b655b2e326634d14df3c4f1b26740849783b64","observation_id":"a41a016f-36df-4e7f-b838-70b05b07b0d0","resolution":{"observed_at":"2026-08-06T20:44:22.321672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.295742Z","title":"A circumplex model of affect","venue":null,"work_id":"745a6db5-f08e-40e4-9cb2-eff25327e0b1","year":1980},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.217149Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:51019d5d49bb80099a7fcdeffef6b7db8c774c909d92fb7d67af66db0636b143","observation_id":"543975f0-aafc-4157-b92c-6c86b83084c3","resolution":{"observed_at":"2026-08-06T20:44:22.300250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.282284Z","title":"Audiovisual three-level fusion for continuous esti- mation of russell’s emotion circumplex","venue":null,"work_id":"71ec7de2-bc27-487f-9143-0d21d93f1035","year":2013},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.255287Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:049a9e501b3dd2fd70cef7dee4a972bcd7079b374f64576efe4518614ef9ca2a","observation_id":"c428f214-0690-45e6-8a23-a6e3cbea8a92","resolution":{"observed_at":"2026-08-06T20:44:22.286943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.269055Z","title":"A novel spatio-temporal convolu- tional neural framework for multimodal emotion recogni- tion","venue":null,"work_id":"238afc13-38da-4b7e-8db5-647d6a6dc4b3","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.360945Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:8e29a51ea467829b0c72e180b1c4edba46b3aa1477f18bcca6cd5ad97e584d79","observation_id":"ad5e7b5c-8cc5-4889-9ddc-d298476ccd5d","resolution":{"observed_at":"2026-08-06T20:44:22.273441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T20:44:20.510410Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.510410Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:504f4b596ddb8121a2df109366e7f4f9c4ce6d3996f3c95599e1dd3279df325b","observation_id":"91beed96-c190-4ac6-bd46-7688cd6f4ba9","resolution":{"observed_at":"2026-08-06T20:44:20.510410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.256730Z","title":"Using deep and convo- lutional neural networks for accurate emotion classification on deap data","venue":null,"work_id":"4eef0330-29fe-424f-8c74-5e9d53ab1a2d","year":2017},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.674265Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5abaa0a7f52f3df4933f1e556e95eacd58af703640483816a8c2a983b676004b","observation_id":"cac217ec-d3c4-43c5-9e2b-692481e93f27","resolution":{"observed_at":"2026-08-06T20:44:22.260945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.243446Z","title":"A multimodal fusion emotion recognition method based on multitask learn- ing and attention mechanism","venue":null,"work_id":"b15bf87f-5706-49e9-ba9b-34decca9e67e","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.836939Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:e17f43ee6aedb9bbdd7a3917583ef1897119539c806ad7dd0806a61eff250de5","observation_id":"c07c6317-b39c-40a4-aa56-453a65d37877","resolution":{"observed_at":"2026-08-06T20:44:22.248034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.230462Z","title":"Speech emotion classi- fication using attention-based lstm","venue":null,"work_id":"1abf8895-0579-43e0-9988-8888fcc74ec3","year":2019},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.972089Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:651912138d385a341e35e4123962a5bc50ddcb8cfb90ebf08e67874e1e690bbf","observation_id":"f267650b-37ab-4af0-bc62-5b54419ca85e","resolution":{"observed_at":"2026-08-06T20:44:22.235505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.216624Z","title":"Aff-wild: Valence and arousal ‘in-the-wild’challenge","venue":null,"work_id":"a1259f62-9376-40c3-8cb7-f9aecc7c7b39","year":2017},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.131157Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:089d48030bbf2314c316f356e493ae498354b47af3037f4a4e210f43795821c0","observation_id":"a68ac420-a847-4c99-85e2-fa76362146d5","resolution":{"observed_at":"2026-08-06T20:44:22.221544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.202632Z","title":"Contin- uous emotion recognition with audio-visual leader-follower attentive fusion","venue":null,"work_id":"b717f5fe-fdd4-459e-a41d-6229b0cafe76","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.248080Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:bd268264f5d34ab8387c0493bdb1ab57bc170c25bcbf9e16b51d3b8cfe379e62","observation_id":"c4de6969-7af0-4d76-9c8d-bd0928d60140","resolution":{"observed_at":"2026-08-06T20:44:22.207270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.189365Z","title":"Deep learning-based multimodal emotion recognition from audio, visual, and text modalities: A systematic review of recent advancements and future prospects","venue":null,"work_id":"a6001d1a-d52b-4ac9-91ad-0ca5e200d91c","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.431220Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:69ec26360382216b46b1dd1ea809ddecfa6d98f9caf9395c52dab26fa8816d9b","observation_id":"646e9ce0-f87b-431d-aaef-98771a0308ce","resolution":{"observed_at":"2026-08-06T20:44:22.193649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.175285Z","title":"A multimodal semantic fusion network with cross-modal alignment for multimodal senti- ment analysis","venue":null,"work_id":"d81ed351-a03c-4235-b10a-4e588c7a3001","year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.548405Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:b0d42fc8e47cb862529f7a653e80fb86d6aac7a188421db3912ff5fc9e11e645","observation_id":"f8e8e021-4d5d-45f9-b6b5-a3bba7ac3114","resolution":{"observed_at":"2026-08-06T20:44:22.180022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.161888Z","title":"Multi- modal facial affective analysis based on masked autoencoder","venue":null,"work_id":"aa0fae02-d7fb-4bba-b1b6-ffc83cefa68f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.649389Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:57a7c37cee5099b2e5bf241abf6ba62f088630bca646fac0e168f758d9597ffa","observation_id":"c9d76662-b285-4b16-a3b5-553657319efd","resolution":{"observed_at":"2026-08-06T20:44:22.166333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.148852Z","title":"M 3 f: Multi-modal continuous valence-arousal esti- mation in the wild","venue":null,"work_id":"47669b6d-f001-48c2-a71c-0f4288e363ea","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.800076Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:76051d5c2a3830a595c220717110d70a7b699c2a50c1f7aca989f635457efe90","observation_id":"b89931c9-4efb-44d9-9979-170bebca94ed","resolution":{"observed_at":"2026-08-06T20:44:22.152792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.135690Z","title":"Abaw5 challenge: A facial affect recognition ap- proach utilizing transformer encoder and audiovisual fusion","venue":null,"work_id":"e6b49fdd-b195-465c-8b06-16ee483911a7","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.935182Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:1545ecfefb87683fa7335ad0e09510ac1cee2d7448ae2f374732a7c35cd38163","observation_id":"c8d857d8-c9ab-4673-ac44-4a7a6b3a2ee5","resolution":{"observed_at":"2026-08-06T20:44:22.140098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.120822Z","title":"Leveraging tcn and transformer for effective visual- audio fusion in continuous emotion recognition","venue":null,"work_id":"b6ec8f4c-b961-4844-b0d4-9f3a284ddc7f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.971254Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:a79d7b21d1b3b9281349a3d65ad38ce6f3b4b935bbb662223126ec3444ec1b1a","observation_id":"cb3d9f7c-d28e-4d25-858d-fa86bcbab7c2","resolution":{"observed_at":"2026-08-06T20:44:22.125976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T20:36:20.550513Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2507.02080."}