{"as_of":"2026-08-20T18:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbf1ee3852a05926dc9c4f42300bca5bf0f4399bc6ee02e3de3a125b4fe1338b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:00:12.849066Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.02331/citation-record","integrity":"/paper/2505.02331/integrity","json":"/paper/2505.02331/citation-record.json","paper":"/paper/2505.02331"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.873704Z","title":null,"venue":null,"work_id":"93122a25-1530-4032-95ef-a80fd56046a1","year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.579333Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:157dd39a8ac9e0400cad3ca30d9bab37cb78a687b1afc7c1174fbac6bc45b8dd","observation_id":"c31e994f-57a7-4366-acd2-6fca84c91fc4","resolution":{"observed_at":"2026-08-16T01:00:13.878447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.858750Z","title":null,"venue":null,"work_id":"7c7236e8-4b57-4468-ae00-6ad5dca0f2e3","year":2025},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.584529Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:0a050d25e9153427256435804db1293bc9764dfa5dffba4292e6fed56e80b2d9","observation_id":"117d2726-92a0-468e-aa11-3a4f0b2a4d13","resolution":{"observed_at":"2026-08-16T01:00:13.863488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.843278Z","title":null,"venue":null,"work_id":"0bb99ca2-6999-4c39-a5a3-929b1e8c667b","year":2016},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.589164Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:9b26806c4e61d1a79884c0f901ddfbfcfcaf0d4f9be6bda2bb432317a0044b01","observation_id":"00fd8f8b-d901-40ec-8b1e-6e658febbefb","resolution":{"observed_at":"2026-08-16T01:00:13.848157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.828567Z","title":null,"venue":null,"work_id":"6fb55446-03af-4858-bad5-9af4c3d0836f","year":2014},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.593996Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:c2fd145f1651cb054ef7de00ddcfd1dc65478c24a2b8f71af67a98a71ee5cca5","observation_id":"d4eb3a06-dad9-4d4d-98a0-50000090eb05","resolution":{"observed_at":"2026-08-16T01:00:13.833043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.813348Z","title":null,"venue":null,"work_id":"4d1d5394-5c71-47b9-b9b8-f4e3080fdec8","year":2018},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.598413Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:bf6578d2e9600f7a9cc3e4ad80febdce8948ae0525db8472ad3277658533706b","observation_id":"809a1b66-66f3-4dbf-beed-ff2152e7dde7","resolution":{"observed_at":"2026-08-16T01:00:13.818311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.603048Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.603048Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:969a164548b1fc2b1d656f6e35a13a63f36a07c4a8773357b0c248e26ba6c71e","observation_id":"3a991a0e-6536-4e80-944a-e31e943087b6","resolution":{"observed_at":"2026-08-16T01:00:12.603048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.612024Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.612024Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:d882f4ed91aee19012c210e349b71a558497fada96efeded3d6f71733dfdabf4","observation_id":"b3534c4a-97b2-4a5e-a4b8-838a7c499a25","resolution":{"observed_at":"2026-08-16T01:00:12.612024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.762925Z","title":null,"venue":null,"work_id":"b1189078-d21f-403e-9da6-08c196130fdc","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.616908Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:f557215de5f0eb0887e9bcbb48c4ac8a304ed873ca88c1044490fe0b5d030e98","observation_id":"32956e3a-2994-4337-82af-5ee481b5fcf2","resolution":{"observed_at":"2026-08-16T01:00:13.767712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.621231Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.621231Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:7df42b99b1b5d667a873aef79c6b5522e798b5706204ae2073e481149fe1c650","observation_id":"3147e6bc-2981-40d0-9555-ddfc37631ed9","resolution":{"observed_at":"2026-08-16T01:00:12.621231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.625674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.625674Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:33bc40c7278acd76f18c860257961016859bda80bb9e6c05853c331b608cc979","observation_id":"7e56d1b5-d776-4bd0-ba4d-a7605e9fcc0d","resolution":{"observed_at":"2026-08-16T01:00:12.625674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-16T01:00:12.630238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.630238Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:fba4aa80d433a3c435e201b8e442dc1d2fbcc7123bdbdbbd4d1ff54042003fc1","observation_id":"edbb8e37-9899-434f-bb4c-4054f60d975d","resolution":{"observed_at":"2026-08-16T01:00:12.630238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.735997Z","title":null,"venue":null,"work_id":"bd365c24-bfe3-40b8-9414-22371bcae368","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.635106Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:ba6913a9f2eb2675095fee9a40090b784e0972a0cd32e144e6ad72a82060f442","observation_id":"b4de128f-9330-4663-bbd7-2292adbe4ca1","resolution":{"observed_at":"2026-08-16T01:00:13.740657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-15T02:39:00.334605Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-16T01:00:12.639418Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.639418Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:0f25b35ba93f9f88efbe9c8c384402b389474de6df5cbcf4f741544757933508","observation_id":"13206ece-b677-4726-a8f8-535b9fbc5884","resolution":{"observed_at":"2026-08-16T01:00:12.639418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.721006Z","title":null,"venue":null,"work_id":"44fffa17-9821-433e-9a7b-b222a8ce864e","year":2018},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.644627Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:4fc0e3f68f6575a3a6d1bca08f401699b08007aee24bd66bd95f9c85a96f2620","observation_id":"954ad89e-cd69-4281-a32d-4be7f320274d","resolution":{"observed_at":"2026-08-16T01:00:13.725781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.705616Z","title":null,"venue":null,"work_id":"bddfa530-53d5-4227-9c7e-af73873e420a","year":2015},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.648927Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:d4616d2570aef9155b71b538499ae9c54a23a952c7a9215e26bd11c28c1bdf3d","observation_id":"27221cfa-10b8-4ba5-8742-3615982dff9f","resolution":{"observed_at":"2026-08-16T01:00:13.710568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.690600Z","title":null,"venue":null,"work_id":"18db0ed8-5521-49fc-9be5-ee841e29eae7","year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.653434Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:b82d00230964b451ddd870cf49f7a48d557e13a0f06ea262ea6fb20ac1ae14f4","observation_id":"986d92e4-017e-49ee-bb9b-b66b3ba1abf3","resolution":{"observed_at":"2026-08-16T01:00:13.695111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.675581Z","title":null,"venue":null,"work_id":"6e271546-0dd5-47f4-8960-5d6e4ae2d614","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.657913Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:bc23f761fb1bb0d8c2503f511b3912df12005d63dbcfdf14706d89608f947c84","observation_id":"c261da68-cb61-4c1a-a16d-505d941c70f9","resolution":{"observed_at":"2026-08-16T01:00:13.680777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.662250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.662250Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:b03f885dd7df46eff064a55bffb3c18e9aa983bfea3d4d7ea1a394da529452c2","observation_id":"1863697a-e724-4815-ab84-f0ebb5042adc","resolution":{"observed_at":"2026-08-16T01:00:12.662250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.640509Z","title":null,"venue":null,"work_id":"dcc4680b-5190-430d-8458-cba1c9e6d2cb","year":2021},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.671754Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:af0ab1ee61ac251365133a743aa002727784bb35ec414a2d10a36d06fc1e356e","observation_id":"6eef3bfe-7d27-42dd-be87-0ba385eadca8","resolution":{"observed_at":"2026-08-16T01:00:13.646021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.624242Z","title":null,"venue":null,"work_id":"e0c95d8b-bea5-4500-96d6-f315306e359c","year":2019},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.675980Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:d020adc939ce17caf0707917d5b2cafa9c4b7ab167c1c087bd3df896d8244c93","observation_id":"9987594b-766d-4311-b623-eea519f61726","resolution":{"observed_at":"2026-08-16T01:00:13.629275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.609296Z","title":null,"venue":null,"work_id":"b921f265-73f2-4f6a-a8e4-5fa9105a2ca0","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.680401Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:17c57ef01b794c91801c129c8b6dd848886fafe0ea41c0a4b30aac28f6b55355","observation_id":"3cdb5f90-d811-4ae1-a023-5181ef3e2644","resolution":{"observed_at":"2026-08-16T01:00:13.613819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.685013Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.685013Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:b5af3d28c5c25662dbabd088cb7e13e4a968f873615c854d7806f22c0e3fc770","observation_id":"14176749-b827-4f7e-b152-a6cf74974736","resolution":{"observed_at":"2026-08-16T01:00:12.685013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T01:00:12.689350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.689350Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:8b4f4b15728ea08fb55f6b6519ab34bc720f451ae431f9264325f6efe9435a79","observation_id":"17967234-bad8-4cdd-a864-689f5b4c3dc7","resolution":{"observed_at":"2026-08-16T01:00:12.689350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09541","last_updated":"2024-06-26T14:10:00Z","snapshot_observed_at":"2026-08-16T22:31:36.047835Z","submitted_at":"2024-06-26T14:10:00Z","title":"MATE: Meet At The Embedding -- Connecting Images with Long Texts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09541","snapshot_observed_at":"2026-08-16T01:00:12.694222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.694222Z"},"links":{"cited_paper":"/paper/2407.09541","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:3c5a24c41efb8454cbba1a5c7c2bc40b79718ca72260fea7aa47469d82fe8705","observation_id":"8c990715-bc23-470e-9d2e-29ae85df5d95","resolution":{"observed_at":"2026-08-16T01:00:12.694222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.698987Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.698987Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:63efaf90082f047a80ce0f484925f7181c64526aee77a5ad84a37f00c8427bd6","observation_id":"43c40ec2-44f7-41be-933d-b3f1b0079236","resolution":{"observed_at":"2026-08-16T01:00:12.698987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07770","last_updated":"2019-12-13T23:44:20Z","snapshot_observed_at":"2026-08-19T11:01:59.767422Z","submitted_at":"2018-11-11T01:57:15Z","title":"Aff-Wild2: Extending the Aff-Wild Database for Affect Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07770","snapshot_observed_at":"2026-08-16T01:00:12.703532Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.703532Z"},"links":{"cited_paper":"/paper/1811.07770","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:6a104d2fdb44542240f451af59b8a527bcaf8f77ee1312a1bda39fe8dcd1897b","observation_id":"2e3b611b-ed70-4d92-a03f-91131b70df3c","resolution":{"observed_at":"2026-08-16T01:00:12.703532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.576221Z","title":null,"venue":null,"work_id":"25a2f485-8324-421f-afb5-8cac564e2c39","year":2025},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.708052Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:ede6c751149ad2186a31629fa24d230a139d51b24c541e08e3ccf009c8f3f152","observation_id":"d09d22fc-e6b7-439f-8a0f-968ddbeab11a","resolution":{"observed_at":"2026-08-16T01:00:13.580624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-08-19T08:30:32.631359Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-16T01:00:12.712442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.712442Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:2f5b369a7c32e12cb4cd7eacb8cd529751f13a32b8dfeafdd37bf65ca056adb1","observation_id":"6a359ecb-9590-4ccc-b40b-e4b21e574547","resolution":{"observed_at":"2026-08-16T01:00:12.712442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.561701Z","title":null,"venue":null,"work_id":"e94ecfd7-7c46-478d-8e40-8ade72d0ef62","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.717251Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:dd75358bcf32acd80f2c140a0119149521a13f193be23e96ae831902035d61fa","observation_id":"8a2f605e-b4a3-4568-b80b-137a3c1e69c4","resolution":{"observed_at":"2026-08-16T01:00:13.566344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.721571Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.721571Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:7a4e0d74bc39607d5ca7d0c60d84fa75b08f87291571258b30948b11081d0eb3","observation_id":"2049deee-8a1b-4ca2-ae8f-c460bab60f1d","resolution":{"observed_at":"2026-08-16T01:00:12.721571Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.725865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.725865Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:c2ef635e523657be97cfec16535e17c48708ead49b24488d53a40afa6c7c7dbd","observation_id":"34470444-dcd9-4047-88e1-29a6148689c9","resolution":{"observed_at":"2026-08-16T01:00:12.725865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.535521Z","title":null,"venue":null,"work_id":"9c06c1a3-0021-4732-b1e0-8110215d6d06","year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.730223Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:6044e1e3bc25fb2601e3155bf2183c80054cb7428cd22bcffd7ac987bd80b38b","observation_id":"c666688d-c98a-4f0c-83cb-a7279d690fc1","resolution":{"observed_at":"2026-08-16T01:00:13.540928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.520263Z","title":null,"venue":null,"work_id":"2c1530fc-abee-47ce-86fe-469a5bc8cdea","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.734309Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:181bc1fae35c8daf437470d6380b13d433acb1e961fbcbcfcaa9f473b9ea23eb","observation_id":"a500cb3a-d26e-44e7-87f3-a101af7acbb5","resolution":{"observed_at":"2026-08-16T01:00:13.525147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.505872Z","title":null,"venue":null,"work_id":"7be46a2b-1858-4b35-98dd-be1ea001d312","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.739922Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:f18516b6293b0929fd14eb27658057215bec0648801e46703dd524deced22634","observation_id":"98013e1d-7631-4f3b-bd7f-c34560afc7e1","resolution":{"observed_at":"2026-08-16T01:00:13.510367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.491202Z","title":null,"venue":null,"work_id":"79237484-67a6-434f-b759-5082bf731e6c","year":2017},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.744359Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:6cdc5d8bbeb00068130e57ba86fb97148ad32cfae1aa64ca83be861491fdcff2","observation_id":"cfe78b72-d7be-4720-951b-e3f78235bd44","resolution":{"observed_at":"2026-08-16T01:00:13.495688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.748586Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.748586Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:4116df0253ac72cd01fdaf5ad6d6196452b2bd93feb1f9948f8d78233ea64286","observation_id":"aa977a37-200e-478a-b1a5-d64d68af6fab","resolution":{"observed_at":"2026-08-16T01:00:12.748586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.456375Z","title":null,"venue":null,"work_id":"261a9014-8842-4083-ac89-a2be70bb6842","year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.758297Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:76dcd229a6754a4790782da785d1123d32bf72064c8987f635822b86cefe22e2","observation_id":"23a85900-5265-45c6-9eac-61636ab6e9da","resolution":{"observed_at":"2026-08-16T01:00:13.461434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.440166Z","title":null,"venue":null,"work_id":"659c6550-d386-41f8-86e7-110507b7f90a","year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.763299Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:0fbe375baa5fe058c2fd3b9fec3790a7cd77402f91f5240dc83591c5571dcbfe","observation_id":"413111bb-089d-4538-9199-0b6306089947","resolution":{"observed_at":"2026-08-16T01:00:13.445139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.426047Z","title":null,"venue":null,"work_id":"8f3c65d5-30ae-4b7c-a84b-202a57e03dce","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.767679Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:39fb978e0fc5031e9acefb3bded5264e4b986e4720412ed51b8a299e72a3585b","observation_id":"9b535970-97fb-481b-ae9b-3ca81b823758","resolution":{"observed_at":"2026-08-16T01:00:13.430456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.411742Z","title":null,"venue":null,"work_id":"b6050e1d-cdb0-4b55-ba5a-ff306138438a","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.771951Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:f4352055773834aa734b5b660402bbcf8d62e8e4070c61d6c8e44425ca5b0a2e","observation_id":"dd63ee39-e1a6-4a0d-8b06-daee0413ab33","resolution":{"observed_at":"2026-08-16T01:00:13.416397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.396958Z","title":null,"venue":null,"work_id":"28e83c3c-9006-436b-bdde-417250c67aa9","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.776427Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:d42305f21bb3913caafcdac56158ad2e7f0362d14a1130f0bcdc4671b229581a","observation_id":"d1dd18fe-6457-45a7-83f4-61b452c7f077","resolution":{"observed_at":"2026-08-16T01:00:13.401655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.382344Z","title":null,"venue":null,"work_id":"9e926c28-51cb-4f51-b9e3-a4d4d00f110f","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.780676Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:6979c2b37eb03fb2bc36e08310c85e842a84aea9cf48afc554763a2f2d0149f1","observation_id":"506a770d-7663-4fb7-92b0-c2e184361400","resolution":{"observed_at":"2026-08-16T01:00:13.386906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.785316Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.785316Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:260375f370fec614fe71a5c0b4fe8be02d27a07a1ae7a1198630b34ced3f68ac","observation_id":"78c44cba-6812-4147-92ae-512185f98d13","resolution":{"observed_at":"2026-08-16T01:00:12.785316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.356218Z","title":null,"venue":null,"work_id":"127bbe93-415a-4457-af04-d6a65d6f474a","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.790105Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:eed686501775ad4156c1f6349bb60f1581b5d76f459e7e11b531fcb3a54ce4f4","observation_id":"a9b06549-fe43-4e96-92bb-84eb74fd9bcd","resolution":{"observed_at":"2026-08-16T01:00:13.361355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T01:00:12.794397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.794397Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:33f187da7decbe629088a00de41ddec0befe5d8bb0a36daf4b4efcf0d6197f61","observation_id":"3731270e-3ad1-42b2-b426-1f8187c853ab","resolution":{"observed_at":"2026-08-16T01:00:12.794397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.340216Z","title":null,"venue":null,"work_id":"3612d6ec-fd50-4b0e-9506-4d14f6b242df","year":2022},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.799312Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:33e2b14e8e38ad29c0ad8a0c38e11fbed405e0e6b77314871648913db8a58232","observation_id":"279b9f27-f5f1-4d99-b776-86400b676992","resolution":{"observed_at":"2026-08-16T01:00:13.345008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.325019Z","title":null,"venue":null,"work_id":"19fb5636-8aef-4635-8616-6aaa5275dd64","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.803632Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:bb02345b83d9e99984b05f0f0e1aa81dfa1b483bd6a2fc2f332f4100d323b520","observation_id":"a1f16dae-58ec-47c1-9a1c-dbc4060ff297","resolution":{"observed_at":"2026-08-16T01:00:13.329658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.310436Z","title":null,"venue":null,"work_id":"758f7166-d4f4-453c-8e47-c9a8770f53ea","year":2014},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.808061Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:95663b5d778d11457db5ec1f103d94a191b2eae7acc738edf7db4d357f0d4c94","observation_id":"0c25c679-50af-49a1-a308-7b195010e35c","resolution":{"observed_at":"2026-08-16T01:00:13.315000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11424","last_updated":"2024-08-21T08:28:40Z","snapshot_observed_at":"2026-08-19T20:58:07.569875Z","submitted_at":"2024-08-21T08:28:40Z","title":"EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11424","snapshot_observed_at":"2026-08-16T01:00:12.812995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.812995Z"},"links":{"cited_paper":"/paper/2408.11424","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:bc3a78d98c350cb1ced654f3f279df49b95c02ee8ca2ede395f4f90e0569556c","observation_id":"488e549f-705d-4269-b97c-1559ccfa000a","resolution":{"observed_at":"2026-08-16T01:00:12.812995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.294421Z","title":null,"venue":null,"work_id":"b0fe7a20-d605-42d9-bde3-d4fdcbb70a9d","year":2024},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.817527Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:72f13cd046907df036ee7120abf0114f6bb4828fc5e38d8c2f216f725a5d118c","observation_id":"a3795eea-802f-4ee5-9e8d-78af74a7512d","resolution":{"observed_at":"2026-08-16T01:00:13.299940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.279639Z","title":null,"venue":null,"work_id":"b191682a-9171-4543-a62d-54bdd5741e36","year":2020},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.821899Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:0c84565a57d05bc2f105b4d0caabdf76f6aced59d0a691f681f6990b344d810a","observation_id":"44e774a0-a2f8-49d6-a8bf-588cf03e921b","resolution":{"observed_at":"2026-08-16T01:00:13.284174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.826283Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.826283Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:bbb81e5fff8a7d2b19981e99b94c6f672bd8826d6033534fd77e39797b1096cc","observation_id":"cdaa18b3-b3b1-4ac4-bd99-aee398f75188","resolution":{"observed_at":"2026-08-16T01:00:12.826283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.254020Z","title":null,"venue":null,"work_id":"ce3de692-18ff-4a9b-aa7d-3f7f41af2295","year":2021},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.830842Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:6499aec3e15b489e59e8a1405e41851fd189855eee29347b080e858ddd86d1da","observation_id":"864f81b5-6095-404d-906e-c71b5be848eb","resolution":{"observed_at":"2026-08-16T01:00:13.259523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.239175Z","title":null,"venue":null,"work_id":"2efe7d9e-82fd-43d4-b3b8-1f22ab4ac831","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.835243Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:b193695730e20ed3529efd55cf13637a7f7221bbd6551a80292321f0061d452a","observation_id":"bba19b9e-7b4b-489e-bb5e-5cb54649cb0a","resolution":{"observed_at":"2026-08-16T01:00:13.243870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-18T15:25:55.049244Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-16T01:00:12.839717Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.839717Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:b724ff4c328d36f69b75b4f52c3d876e06ea065af5e42013e3ca0142066bf472","observation_id":"450e730d-a8ab-42d8-978f-cb6bc7bd9804","resolution":{"observed_at":"2026-08-16T01:00:12.839717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.224065Z","title":null,"venue":null,"work_id":"98808e56-aec0-4f02-8590-50a663f730a2","year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.844394Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:671f15e2d706fb6359ca59ee6dc3e4bc84b4c28a52f8ae4b9e464a0bf0e55d2d","observation_id":"b595f2db-a94e-4247-a06d-bd5da6a27229","resolution":{"observed_at":"2026-08-16T01:00:13.229001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.207620Z","title":null,"venue":null,"work_id":"2d963b95-95b6-4ec1-88cc-98e90fbf324a","year":2023},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.849066Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:fb3bf67a1c9c9c4e2b31bd360792ba4128b64db9e04378fba573a976920f182d","observation_id":"7dfd4379-05fa-429d-8191-4640ff81fd46","resolution":{"observed_at":"2026-08-16T01:00:13.213403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.753805Z","title":"In International conference on machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.753805Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:857dfee44c13a4aa23a605e9ddeaa669b1ecf2ebd8fc535577feef18068fec0c","observation_id":"187a746c-6249-4897-b2f8-dc7e985ccefa","resolution":{"observed_at":"2026-08-16T01:00:12.753805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:12.667232Z","title":"InProceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.667232Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:853a5c04b74a1a28e1597d36a5cd3fc4fd0c3766b56927e17405bcc8538d5999","observation_id":"ba703ee6-b925-4c55-bdcd-7b0cd05f9a2a","resolution":{"observed_at":"2026-08-16T01:00:12.667232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:13.787804Z","title":"InProceedings of the 32nd ACM International Confer- ence on Multimedia","venue":null,"work_id":"f37b7bf5-9787-4682-88d6-1f316c68bf9b","year":null},"citing_paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:12.607630Z"},"links":{"citing_paper":"/paper/2505.02331"},"observation_digest":"sha256:941f27c3a3cbfa98b24724b4ad93cca21373b9b7622630cc7633614acdec28a3","observation_id":"c68ff811-bb79-45fd-86c9-fc76ceefaa10","resolution":{"observed_at":"2026-08-16T01:00:13.793596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02331","last_updated":"2025-08-02T22:04:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:26:17.903690Z","submitted_at":"2025-05-05T03:00:51Z","title":"VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2505.02331."}