{"as_of":"2026-08-17T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd193287d05d955397fc59d9dca8fe1bb44be2567398b066e6c5c4ab7537b51e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:42:12.090105Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:17:41.023520Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T17:46:23.724330Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":"2505.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion-qwen: Training hybrid experts for unified emotion and general vision-language understanding","venue":null,"work_id":"66012e32-8628-41f4-887a-97c0216bf181","year":2025},"citing_paper":{"arxiv_id":"2603.02123","last_updated":"2026-04-11T07:33:14Z","snapshot_observed_at":"2026-08-15T07:03:25.268306Z","submitted_at":"2026-03-02T17:42:33Z","title":"Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T17:43:32.593075Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2603.02123"},"observation_digest":"sha256:b4fe83f472fe6565af4cede74f5e82d67102528be99067d1d4aae74b7d02bb5e","observation_id":"63dabb9c-893a-46ea-81ed-7ddaaa2a8493","resolution":{"observed_at":"2026-05-15T17:46:23.727804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":"2505.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotion-qwen: Training hybrid experts for unified emotion and general vision-language understanding","venue":null,"work_id":"66012e32-8628-41f4-887a-97c0216bf181","year":2025},"citing_paper":{"arxiv_id":"2604.15280","last_updated":"2026-07-21T12:12:23Z","snapshot_observed_at":"2026-08-17T14:30:20.074542Z","submitted_at":"2026-04-16T17:49:58Z","title":"Why Do Vision Language Models Struggle To Recognize Human Emotions?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T11:02:51.836285Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2604.15280"},"observation_digest":"sha256:9612d8652c57fcf389bf18214a6e289417fcb41dfff387ead132c480c30183ce","observation_id":"3916d3b2-5826-486a-a4f2-510fd046d8a2","resolution":{"observed_at":"2026-05-10T11:05:08.701072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-08-02T16:11:28.411131Z","title":"arXiv preprint arXiv:2505.06685 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.15280","last_updated":"2026-07-21T12:12:23Z","snapshot_observed_at":"2026-08-17T14:30:20.074542Z","submitted_at":"2026-04-16T17:49:58Z","title":"Why Do Vision Language Models Struggle To Recognize Human Emotions?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T16:11:28.411131Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2604.15280"},"observation_digest":"sha256:a96f7f44fb01d3d0b3fb38ce1bf700b09caea782955a669266c3d7901a25f99b","observation_id":"4fd3833c-1e3e-443a-86c3-6f692ea03a81","resolution":{"observed_at":"2026-08-02T16:11:28.411131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-08-01T08:37:40.713175Z","title":"Emotion-qwen: A unified framework for emotion and vision understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21061","last_updated":"2026-07-23T08:52:11Z","snapshot_observed_at":"2026-08-08T01:13:21.444754Z","submitted_at":"2026-07-23T08:52:11Z","title":"MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T08:37:40.713175Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2607.21061"},"observation_digest":"sha256:1aed2e03104e2c29c35eedfcfb8361826e88ec1cf36452bacdb0edb100ea687a","observation_id":"fe362b4d-5186-4db9-a16b-cfacf28a8b6f","resolution":{"observed_at":"2026-08-01T08:37:40.713175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-08-07T19:27:24.860186Z","title":"Emotion-qwen: Training hybrid experts for uni- fied emotion and general vision-language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06013","last_updated":"2026-08-06T13:18:24Z","snapshot_observed_at":"2026-08-17T18:08:51.282644Z","submitted_at":"2026-08-06T13:18:24Z","title":"OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T19:27:24.860186Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2608.06013"},"observation_digest":"sha256:128e7820a2c7ef61451d6598534c293ca3340dbdf76e4d799b4eba15f2f57b72","observation_id":"2f30f774-95af-4147-b937-ac0b6ceffbcd","resolution":{"observed_at":"2026-08-07T19:27:24.860186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06685","snapshot_observed_at":"2026-08-12T17:17:41.023520Z","title":"arXiv preprint arXiv:2505.06685 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10796","last_updated":"2026-08-11T11:05:22Z","snapshot_observed_at":"2026-08-15T23:36:45.820831Z","submitted_at":"2026-08-11T11:05:22Z","title":"E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T17:17:41.023520Z"},"links":{"cited_paper":"/paper/2505.06685","citing_paper":"/paper/2608.10796"},"observation_digest":"sha256:d4ffbe3de249e6da0195332c5b4afdcccced5d6b33e536949a3d4883ee88d8a2","observation_id":"58a928cc-4535-4e56-a25a-0366fc25e7cb","resolution":{"observed_at":"2026-08-12T17:17:41.023520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.06685/citation-record","integrity":"/paper/2505.06685/integrity","json":"/paper/2505.06685/citation-record.json","paper":"/paper/2505.06685"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:42:11.792804Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.792804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:4b22fee1aa8c8bd6139b1f827c71f8bee9cb6045e11782391dfcf8893d88a064","observation_id":"af794ba9-6ddc-4c0a-a27a-f728a7493665","resolution":{"observed_at":"2026-08-15T22:42:11.792804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.799345Z","title":"L.; and Parikh, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.799345Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:637378e700af822b31e0e84d2f49828945d4b0358677750f077d3c11dab25ac1","observation_id":"f5b74fb3-b37a-4ccb-88ca-e29ae099c98c","resolution":{"observed_at":"2026-08-15T22:42:11.799345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-15T22:42:11.804578Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.804578Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:84cf51a2ba2746b98196e768588472515ef1bb16cf8ea287ec0f9f2fd88be71a","observation_id":"21639998-085a-441d-a70c-4e289aac0f3e","resolution":{"observed_at":"2026-08-15T22:42:11.804578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T22:42:11.810598Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.810598Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:c1781491a9bbaf0dbf5d4cd42c8f4954046299e5e3792c2a3d83868670bb90aa","observation_id":"8f9dde2d-3dcf-463f-b9b2-0c74bcfdd47f","resolution":{"observed_at":"2026-08-15T22:42:11.810598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T22:42:11.815983Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.815983Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:70fad45493f730e233faeb4e6358f621195a5ef0e5e520ad3f3784050e37bf3b","observation_id":"828a9b83-bc12-4516-aea6-6aebc21df63a","resolution":{"observed_at":"2026-08-15T22:42:11.815983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.08092","last_updated":"2018-05-13T10:35:21Z","snapshot_observed_at":"2026-08-15T07:29:52.996240Z","submitted_at":"2017-10-23T05:26:32Z","title":"VGGFace2: A dataset for recognising faces across pose and age","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.08092","snapshot_observed_at":"2026-08-15T22:42:11.821365Z","title":"M.; and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.821365Z"},"links":{"cited_paper":"/paper/1710.08092","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:dcc1a9292339bafe87e429d3d85168e20b78a689e8de3ca8fd1fb275f1210394","observation_id":"b13392e2-e43c-4059-86d2-17f486f4d611","resolution":{"observed_at":"2026-08-15T22:42:11.821365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.813592Z","title":null,"venue":null,"work_id":"dd7a4907-56c3-4e3b-ab27-9d0000d415c9","year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.827703Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:d9b7d18d7af5f66a47962ad740a687c665d67261574930fabb6c4d790b7adf72","observation_id":"f78a218d-dda4-447d-a6b6-f48939a7e24d","resolution":{"observed_at":"2026-08-15T22:42:12.817958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-15T22:42:11.833158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.833158Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:63810f242504d67d0868812087d1432a683406a836e0090c12147ddaa5cc1a40","observation_id":"64c3eb7a-70e0-4631-a1ec-79b9341ac807","resolution":{"observed_at":"2026-08-15T22:42:11.833158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T22:42:11.838290Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.838290Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:b50ef0fc32ac76e896873d58ec8b3313cb81dbecba2c51d300f97458b2afa5c0","observation_id":"b49c341a-a270-48bf-b6bf-bfd4b13a0acb","resolution":{"observed_at":"2026-08-15T22:42:11.838290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:42:11.843533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.843533Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:cd941385a8d1bc4606457b5eb8b4764d4d9c017ec9bcb1d22a3d5528f6cdbaf1","observation_id":"a8da9c9b-3b32-4b84-a804-2ab6bdf2b69b","resolution":{"observed_at":"2026-08-15T22:42:11.843533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-15T22:42:11.848779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.848779Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:670fec4b7cb558a3b32219ed9fbdc4a4f515d876240d011dc30a81bd1eb96379","observation_id":"91a28f4f-14c7-477b-a7c3-9fc03638cd41","resolution":{"observed_at":"2026-08-15T22:42:11.848779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-15T22:42:11.854099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.854099Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:8be7f00240c941cae9920ff8a08ccfaf424d0759f04876c80ccb9a5d0aa83ed1","observation_id":"c49b8c60-6b5c-467a-a677-ee15610915bb","resolution":{"observed_at":"2026-08-15T22:42:11.854099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.797015Z","title":null,"venue":null,"work_id":"2c786714-400d-409a-ad39-0d40ba91fb4c","year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.859105Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:c47d81ad22e4c1f4c04897d476ccd3632b34f45e4cdf2368bca906ad68e04d27","observation_id":"d1b72442-6e85-4caf-ae2e-0c9a43d08a37","resolution":{"observed_at":"2026-08-15T22:42:12.802110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.780439Z","title":null,"venue":null,"work_id":"45208e27-5dc2-46f8-b7a3-f275cc74384a","year":2020},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.863763Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:6adc1f12e676299a9be4f7e68ed6194b04e30847ab44629eeb5e724e74546e85","observation_id":"d8a0e017-855f-44ed-a761-33edea667823","resolution":{"observed_at":"2026-08-15T22:42:12.785812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11911","last_updated":"2024-08-29T05:14:36Z","snapshot_observed_at":"2026-08-16T14:58:51.412701Z","submitted_at":"2023-09-21T09:22:07Z","title":"InstructERC: Reforming Emotion Recognition in Conversation with Multi-task Retrieval-Augmented Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11911","snapshot_observed_at":"2026-08-15T22:42:11.868618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.868618Z"},"links":{"cited_paper":"/paper/2309.11911","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:67ed67efd9cc872832f126d304a785979e4622ed086b642a271fae5ba2000646","observation_id":"d0cffa97-0c2c-4f09-8b29-6542df29bb4d","resolution":{"observed_at":"2026-08-15T22:42:11.868618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.764480Z","title":null,"venue":null,"work_id":"1d412e6c-1347-4eec-bbaf-d853f1b45976","year":2025},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.873768Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:ab30c89daf9314171e772313b32cf9105183f68536e44b283e247d59feb5bb4e","observation_id":"15afa32e-ff24-42ae-84e5-6fa56ccb2771","resolution":{"observed_at":"2026-08-15T22:42:12.769409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.749941Z","title":null,"venue":null,"work_id":"d794a532-1471-4e3c-be7b-e7c8afa4fc79","year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.879371Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:9ac8bcbf0114d7ef2b056559463220f4f07cc68a296d72bcfc508c2fc4ce01c0","observation_id":"530158e2-a107-4082-bcbe-b6017c45ccc1","resolution":{"observed_at":"2026-08-15T22:42:12.754445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16566","last_updated":"2025-05-07T13:20:08Z","snapshot_observed_at":"2026-08-17T05:29:22.456728Z","submitted_at":"2025-01-27T23:18:39Z","title":"AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16566","snapshot_observed_at":"2026-08-15T22:42:11.884383Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.884383Z"},"links":{"cited_paper":"/paper/2501.16566","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:a5936e4aaa77eb38c9b87b3bb15a1743dc0f7939b23c38807c06ef2f6628d39c","observation_id":"f1205854-31d5-4700-b40f-fc49b1129a1e","resolution":{"observed_at":"2026-08-15T22:42:11.884383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.733781Z","title":"W.; and Tao, J","venue":null,"work_id":"bbd31519-1346-43e5-922c-c0a890636360","year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.889644Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:2e3bc3b6aa94d9eceb1ac098f159f8e838fae7fbccb26800f72507fbe7869cba","observation_id":"0eeff096-97ce-437e-93d9-364f2d52f605","resolution":{"observed_at":"2026-08-15T22:42:12.739326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-08-16T15:20:46.756130Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-15T22:42:11.894833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.894833Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:f443c75b0c7346ebf4a549dcf6ff01cecf86b7bdadbf7545ab8479a44f231672","observation_id":"3e866bcb-ff35-42fa-bd6f-a07e04e52490","resolution":{"observed_at":"2026-08-15T22:42:11.894833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17113","last_updated":"2024-07-18T11:23:25Z","snapshot_observed_at":"2026-08-17T04:16:42.381975Z","submitted_at":"2024-04-26T02:05:20Z","title":"MER 2024: Semi-Supervised Learning, Noise Robustness, and Open-Vocabulary Multimodal Emotion Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17113","snapshot_observed_at":"2026-08-15T22:42:11.900570Z","title":"W.; and Tao, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.900570Z"},"links":{"cited_paper":"/paper/2404.17113","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:4f73c4b6745973b28c942a1403bf431197963a831b5d07a2ca2158e457b01491","observation_id":"35418be2-36ff-4279-95fa-ec332e4b01bd","resolution":{"observed_at":"2026-08-15T22:42:11.900570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.718530Z","title":null,"venue":null,"work_id":"ff43e73a-4d09-463e-a9a7-b306f0fea643","year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.905651Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:386b439dd5863fa606f08b6d853804cf5a75d9ef0f2a236495aff9c5f7665c22","observation_id":"e99d7407-bb66-4f34-9c6b-793762d6926e","resolution":{"observed_at":"2026-08-15T22:42:12.723201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T22:42:11.910602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.910602Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:4a6040e78f14c15ba58debb4d52a60b46147947bb00f37fa4695f2e18dca1050","observation_id":"c8a5df56-aa0c-4369-bbff-cd4f12266d37","resolution":{"observed_at":"2026-08-15T22:42:11.910602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.702298Z","title":null,"venue":null,"work_id":"eced9526-03cf-407c-a877-03914338b7b1","year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.915375Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:5ebc9334f444f45ded568d01cc457ded4745305526b9fe2136a982f5f63c99fe","observation_id":"9c2bfd10-04f6-4921-98e1-0d3fe57ebc5a","resolution":{"observed_at":"2026-08-15T22:42:12.707174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.919911Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.919911Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:463833e4928c5db4dce141258bbded1b25bce55e79532bc1b39afbf98637ba63","observation_id":"cef50103-4d32-4714-9e85-80791ad22904","resolution":{"observed_at":"2026-08-15T22:42:11.919911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.676178Z","title":null,"venue":null,"work_id":"97078224-fe0a-45c3-b807-6df578f89005","year":2022},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.924595Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:24787d1809af3aa43f6e93bac92700ab6ba52e759ec10cae3d39072efb429c35","observation_id":"26be52cf-aba8-4bff-b489-a3068c1a298c","resolution":{"observed_at":"2026-08-15T22:42:12.680707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.660109Z","title":null,"venue":null,"work_id":"25794360-553b-4108-85e7-84c9c5373689","year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.929388Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:6c8b032292c30cc73facecba96110ad58083cb638200431ba41a30c4c8557914","observation_id":"d5b4d9dc-df9a-42c4-b303-0b2e03c88141","resolution":{"observed_at":"2026-08-15T22:42:12.664998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.934487Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.934487Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:05662b0ae8faff7af02dcba2de68c244abc569818645e3ff8977539e78df764f","observation_id":"b90d2cb1-19a8-4213-9676-f7f76990ca1b","resolution":{"observed_at":"2026-08-15T22:42:11.934487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.939491Z","title":"K.; and Chakraborty, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.939491Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:048c3e1b1f7f4f653c2201cb242fbf073d21749d6f2d5bf2876e222528a3a8b1","observation_id":"740d6f29-05b6-4528-9d29-25c796d06cd4","resolution":{"observed_at":"2026-08-15T22:42:11.939491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.623786Z","title":null,"venue":null,"work_id":"64edd9a4-af91-453d-bf92-77c6cca2f726","year":2019},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.944692Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:0a968ae5ba0f5d30852a6570fa95015faa40828e75fcbbb093df8f02c9f50481","observation_id":"a434d988-1933-4ca8-9a02-53e6e219815f","resolution":{"observed_at":"2026-08-15T22:42:12.628506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.950127Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.950127Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:11bb6468c69d39f4fdf3c4fcf717b0f79e03576bd91a90cb152d1e294e4ba7dd","observation_id":"5cd4406b-6903-4da1-83f4-5cfb62f3939b","resolution":{"observed_at":"2026-08-15T22:42:11.950127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:11.955014Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.955014Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:7333644dc2fb3b0d04bc3e8a232f7284a5f80295931842c4890d78c92c7bb7d4","observation_id":"3fa24aa5-e45c-4192-a0b7-3844c347022e","resolution":{"observed_at":"2026-08-15T22:42:11.955014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.581302Z","title":null,"venue":null,"work_id":"1085c2ba-f2b5-4f0a-96d2-8c74ac792290","year":2014},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.959971Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:54990fad0c9c11bef0f6c7fc95b54a172f9ac640bdb98e71154e68a4371b6d0a","observation_id":"e6d960e2-5879-44ce-a122-d54f8158d5b2","resolution":{"observed_at":"2026-08-15T22:42:12.586516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.564252Z","title":"K.; Qian, X.; Shou, M","venue":null,"work_id":"2c5e1e8b-0871-4817-8c3e-fe4ed1e1e1d4","year":2021},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.964946Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:c5f973bd2e8d7020bd3b5fb2286dd6ea873b302a07d831c0a68059266f341d6e","observation_id":"95226b08-f910-446a-854d-6ea4e9c809c2","resolution":{"observed_at":"2026-08-15T22:42:12.569140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:42:11.969497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.969497Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:64521febcafd8e0617f4779bc7f3e75c800fd0a1b4e0c2d916206766a33eaa00","observation_id":"7ee5bfa7-0939-4383-9669-6ba62b47d883","resolution":{"observed_at":"2026-08-15T22:42:11.969497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T22:42:11.976207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.976207Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:09e2c00d47051b0b1bddc594acd7c789b4daece59e8fa1c59739850d29fe3867","observation_id":"17c363ca-7fd3-4e27-bab2-874c178595da","resolution":{"observed_at":"2026-08-15T22:42:11.976207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T22:42:11.981851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.981851Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:5f59ee871203495581f9beeebf880efca6c31d9a45d8ba0ae82fcde8f95c0662","observation_id":"2e3331cc-0c96-4235-b5ab-14fa214b4099","resolution":{"observed_at":"2026-08-15T22:42:11.981851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16670","last_updated":"2024-04-25T15:15:36Z","snapshot_observed_at":"2026-08-16T13:57:51.217449Z","submitted_at":"2024-04-25T15:15:36Z","title":"EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16670","snapshot_observed_at":"2026-08-15T22:42:11.986902Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:11.986902Z"},"links":{"cited_paper":"/paper/2404.16670","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:2958d93d34811505bef4fd55a004deadc4b49f4609c1a10dd84f9c01b88edd05","observation_id":"79dadc89-a434-4457-9457-763204d13802","resolution":{"observed_at":"2026-08-15T22:42:11.986902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T22:42:12.007430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:12.007430Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:dc634dfcdb777f7dbb59b13e037b381b4d5c9f3238d163ef36f1fe0931175c24","observation_id":"364d042e-b480-4de0-ae03-172083152355","resolution":{"observed_at":"2026-08-15T22:42:12.007430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T22:42:12.015353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:12.015353Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:404859e23be16a4db7cc571aba5990b879bcbc301ca29c7f9322f040549b30b2","observation_id":"56195804-9e03-4d6c-824d-4a52ab066286","resolution":{"observed_at":"2026-08-15T22:42:12.015353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.545006Z","title":null,"venue":null,"work_id":"be836eb1-32a6-42a9-b7c9-38b562179145","year":2020},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:12.040767Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:c29367cea11ea4e7cd38691949fa67e6b374befb30d37d43e579bf7b8b69156d","observation_id":"3f663787-cdb6-4085-a4d7-d99164d23fb3","resolution":{"observed_at":"2026-08-15T22:42:12.551291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.063992Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:12.063992Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:20a723539ead2ae44683ca49edf20b05aa1c7323c85b394fff014f3456b237ea","observation_id":"f5486604-0cfb-4b86-95c1-d7d54331aadf","resolution":{"observed_at":"2026-08-15T22:42:12.063992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:42:12.090105Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:42:12.090105Z"},"links":{"citing_paper":"/paper/2505.06685"},"observation_digest":"sha256:cd0972b45a51fc8c8a8ef67b737f477c75b4fcee0984ca0ecc3aba247ae5ad25","observation_id":"caf48c83-74c0-4794-9372-33842aca972b","resolution":{"observed_at":"2026-08-15T22:42:12.090105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06685","last_updated":"2025-08-13T07:28:43Z","latest_version":3,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-15T22:33:50.999396Z","submitted_at":"2025-05-10T16:15:26Z","title":"Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 6 inbound Pith citation observations for arXiv:2505.06685."}