{"as_of":"2026-08-08T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:447f9a3253b8df06835a59d13bd5de158d5d4ecb5f7f55db79e1b81feebbdb77","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:07:20.855119Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18109/citation-record","integrity":"/paper/2607.18109/integrity","json":"/paper/2607.18109/citation-record.json","paper":"/paper/2607.18109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.746987Z","title":"In: Proceedings of the 26th ACM interna- tional conference on Multimedia","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.746987Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:d43cf6a5068c76ac5d1a42a3cb836422ec4783f301a50548e09a26ac2d13a27e","observation_id":"d34db4b9-8bdb-4d76-a711-f27c4c5173fe","resolution":{"observed_at":"2026-08-01T16:07:20.746987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.751247Z","title":"Advances in neural information processing systems33, 12449–12460 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.751247Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:e2501b0053f3861ce7913ad72d6728793bb7c02d0a6296e6495890834a0a4a3d","observation_id":"a71f11cd-170a-4889-955e-8b209812d86f","resolution":{"observed_at":"2026-08-01T16:07:20.751247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.755163Z","title":"Language resources and evaluation42, 335–359 (2008)","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.755163Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:271bc3725831e078d20c8770bbb5b613ff723ed5d9a4a8fd412ac50eecf813a6","observation_id":"5ad02a18-bf17-4147-a304-4be4244af984","resolution":{"observed_at":"2026-08-01T16:07:20.755163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.758633Z","title":"Advances in Neural Information Processing Systems37, 110805– 110853 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.758633Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:fab93cc8829a4016a4bdbde0e5395d49dde3432a373cfbb2da09f5fdf7e7d7d5","observation_id":"3c111ef4-0864-4c6a-aa10-5bce1d03cebb","resolution":{"observed_at":"2026-08-01T16:07:20.758633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.762253Z","title":"Cognition & emotion6(3-4), 169–200 (1992)","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.762253Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:7f465bb0b60c87d8b73319f20690ec746e3df9115524f43a59748f954fc2fccf","observation_id":"1d54c61f-44ea-4c3f-a69c-283807d4b5df","resolution":{"observed_at":"2026-08-01T16:07:20.762253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.765653Z","title":"Pattern recognition44(3), 572– 587 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.765653Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:379a3d28a005db15dfc21b680204f230924807c20e54c654394807ad30647f3d","observation_id":"d850a0b5-23fb-41b1-a5e4-f16630461d38","resolution":{"observed_at":"2026-08-01T16:07:20.765653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.769635Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.769635Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:65324c5ace4a560488584f0383c1d42f386e0dcc40fbba87ff0f11c5423c815f","observation_id":"abde0b08-2e67-453f-83db-4f9ecbecdb1b","resolution":{"observed_at":"2026-08-01T16:07:20.769635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.772946Z","title":"In: Proceedings of the Thirteenth Language Resources and Evaluation Conference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.772946Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:3a2876fb18e5e0b1d8c5619e61e2d28601fd4de3ad75c93979b61f26b2f57a3c","observation_id":"f41652ef-8b1a-4edc-bbca-d2cd45df88f6","resolution":{"observed_at":"2026-08-01T16:07:20.772946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.776187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.776187Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:fe8036b0b458ae82857b553a0bc03c1d8a1670af402eac0c9795568cccfc3958","observation_id":"20fd46e3-1fba-4e87-87f1-cf5e9931356b","resolution":{"observed_at":"2026-08-01T16:07:20.776187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02167","last_updated":"2024-12-04T02:08:13Z","snapshot_observed_at":"2026-08-07T22:16:46.294568Z","submitted_at":"2024-03-04T16:13:39Z","title":"EMOVOME: A Dataset for Emotion Recognition in Spontaneous Real-Life Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02167","snapshot_observed_at":"2026-08-01T16:07:20.779638Z","title":"arXiv preprint arXiv:2403.02167 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.779638Z"},"links":{"cited_paper":"/paper/2403.02167","citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:f38c5bbd7f070dbe0fa6ca273cd0910dabc8e2f8d901f0aac790ddd12668895d","observation_id":"bdb71b62-b7c0-4ae4-bc2c-d7b4af0d3363","resolution":{"observed_at":"2026-08-01T16:07:20.779638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.783208Z","title":"In: Proceedings of the 28th ACM international conference on multimedia","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.783208Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:42aeca736b01b6a389f17cc9055653fdc3018bc2874e7e29f1793e57c563acdd","observation_id":"863eeaf3-c17f-454b-bc76-e812b0775b45","resolution":{"observed_at":"2026-08-01T16:07:20.783208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.786717Z","title":"biometrics pp","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.786717Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:5483e2ca8d4cb2e29f0499c1d010e6ebb950be979e2fddbd422282f978226f86","observation_id":"c54ce121-a987-49f8-9b53-7f55296db70c","resolution":{"observed_at":"2026-08-01T16:07:20.786717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.790045Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.790045Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:8f690aeee236722daaccdec3d651c8095b6579748b892bf634bcf5e40c40ac88","observation_id":"10855402-6695-4ee2-8f08-4fb617f0272d","resolution":{"observed_at":"2026-08-01T16:07:20.790045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.793259Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.793259Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:aa025b481c0a7cf7cc65250b4504f4d7ec14447c95f1dc442d38d44ea022a3d6","observation_id":"703481dd-f506-40ac-8e66-cfae3ae1f501","resolution":{"observed_at":"2026-08-01T16:07:20.793259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.796440Z","title":"PLOS ONE13(5), e0196391 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.796440Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:c6a1a8ec71e2284877e4f8d11955735f4bc3fdad9e4eba0b8cb6b1e6f28be74a","observation_id":"25636af8-aac0-4249-bb46-6daf067b005d","resolution":{"observed_at":"2026-08-01T16:07:20.796440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.799609Z","title":"In: 2011 IEEE International Conference on Automatic Face & Gesture Recognition (FG)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.799609Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:123116d79a45f4854f3fe5ca2c8008dd53c1e1152fbbd87e81e97d4e9354e05f","observation_id":"c3bccdd9-99a4-44cf-8b20-c253c5b12f25","resolution":{"observed_at":"2026-08-01T16:07:20.799609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.802712Z","title":"Proceedings of the 18th ACM International Conference on Multimodal Interaction (ICMI) pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.802712Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:e73a58968c3100eafb777b1d7cc1fb3a8370f648781f1eabd966ecccdf88623f","observation_id":"c34ba2fe-ab62-4fd3-8175-b928e36e1eba","resolution":{"observed_at":"2026-08-01T16:07:20.802712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.805829Z","title":"MIT Press, Cambridge, MA (1997),https: //direct.mit.edu/books/monograph/4296/Affective-Computing, accessed: 29 June 2026","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.805829Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:60bbdbde2fb9bd87521ef36e2226ded29599e4af5d4d975661692d1748afe3b1","observation_id":"cb20c042-e30c-41a7-a0b6-e9fd2ad513df","resolution":{"observed_at":"2026-08-01T16:07:20.805829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.809157Z","title":"Information Fusion37, 98–125 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.809157Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:79c8cfdf50fe64df0eae4483fe384e674fe263365334aca782fe0f8fb69807aa","observation_id":"7dec5bc0-424c-4082-bd5d-29a88d3dfdac","resolution":{"observed_at":"2026-08-01T16:07:20.809157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.812386Z","title":"In: Proceedings of the 57th annual meeting of the association for computational lin- guistics","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.812386Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:77704ea9b8b88ade841ee2a40587e3dc608aa51a907260069b314fe5eae1b69d","observation_id":"c7c861b5-278a-4890-ab38-604fa97cc44d","resolution":{"observed_at":"2026-08-01T16:07:20.812386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.815793Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.815793Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:cf5f95cf9b5f7285edf73a614a58f13c5943a4372164ba08bf59e963f57955a5","observation_id":"54a360a0-ced9-4824-ba27-bd4f9f10a36b","resolution":{"observed_at":"2026-08-01T16:07:20.815793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-01T16:07:20.819011Z","title":"arXiv preprint arXiv:1910.01108 (2019)","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.819011Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:8796716a508f74b77c1a6c3eff2b2df42e826169ecb9e9cc054dfcd88cdc188d","observation_id":"994571c1-5f9e-44fe-ad47-af63dc949054","resolution":{"observed_at":"2026-08-01T16:07:20.819011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.822605Z","title":"Speech communication53(9-10), 1062–1087 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.822605Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:e7b4d9c31a3ee3b66dcb09e2dd77d2fee26e4fa71fc1c347122cd9ebe0f7f80a","observation_id":"a7241ebd-00f5-4026-97de-5902fe6b9f10","resolution":{"observed_at":"2026-08-01T16:07:20.822605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.825680Z","title":"In: Findings of the Association for Computational Linguistics: ACL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.825680Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:b132976a2c63d5bb7dd2a0dfa05ef26fd3c3a841dc8bbab78c7ef6a5febe8618","observation_id":"000afc25-862c-4665-a060-8db841c3291e","resolution":{"observed_at":"2026-08-01T16:07:20.825680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.832100Z","title":"In: Pro- ceedingsofthe57thannualmeetingoftheassociationforcomputationallinguistics","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.832100Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:a4ef547abaebe60075a0eac02766392612aa7b811feafa77e62dabac6956c1a5","observation_id":"6b91eb89-2380-43d9-b682-cdf803f54c0f","resolution":{"observed_at":"2026-08-01T16:07:20.832100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.835298Z","title":"In: 2024 International Conference on Ad- vances in Data Engineering and Intelligent Computing Systems (ADICS)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.835298Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:fd39b116c57a7dceb545b1f7cace7f3b4130d03a7c49394a5c366ee8c6578b98","observation_id":"b460f5d3-d567-4006-b06f-9bdac8ec307b","resolution":{"observed_at":"2026-08-01T16:07:20.835298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.838494Z","title":"IEEE Intelligent Systems28(3), 46–53 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.838494Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:7560fea2e772ffd4bdda09f5ef6d3764a231dd5afeae84f9d0655357e879f4c6","observation_id":"f9f3549d-d9b4-4dce-abcb-d026b05bccaf","resolution":{"observed_at":"2026-08-01T16:07:20.838494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.841853Z","title":"In: Proceedings of the 56th Annual Meeting of the Association for Compu- tational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.841853Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:216febc34a7bdd4b0e7836cdf8c4bddd9371b39fb3c816f9924c5b632e6aabb9","observation_id":"b3314564-2bb8-4298-8611-f9ac2c5b03aa","resolution":{"observed_at":"2026-08-01T16:07:20.841853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.845032Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.845032Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:c727e464e3f52c9c5ffa12932f6c3c4739e53b2c8f4570350615fd221b07cb3e","observation_id":"ed4bec06-ab96-4d01-bcd0-ad14d706293f","resolution":{"observed_at":"2026-08-01T16:07:20.845032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.848368Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.848368Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:d82f875ed035efea0cb8a0f924afb228a43d0037e632dc91ecd3834579bbe000","observation_id":"df0b730d-1162-4dd9-aef6-4a852e471284","resolution":{"observed_at":"2026-08-01T16:07:20.848368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.851756Z","title":"In: Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.851756Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:79b23801fb45c6c53c801412c15ff63460f6eea0e80ef48cf4bad2015df02f3c","observation_id":"03b102d5-b37d-484e-a574-8bc093bc4df8","resolution":{"observed_at":"2026-08-01T16:07:20.851756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.855119Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.855119Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:9ec426b21e55e0c547ca460dc40dc273922cdfa05aab7a995b8757a729e80a70","observation_id":"84867150-3d52-4d03-8b5a-adb54caa8299","resolution":{"observed_at":"2026-08-01T16:07:20.855119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:07:20.828987Z","title":"9054–9071 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T16:07:20.828987Z"},"links":{"citing_paper":"/paper/2607.18109"},"observation_digest":"sha256:3eeb38b39d698f95586545ed047cc35ed46e657cc932d867ed6ae4088c8f928e","observation_id":"61992088-b986-4f29-877d-901c58583b5f","resolution":{"observed_at":"2026-08-01T16:07:20.828987Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18109","last_updated":"2026-07-20T16:08:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T11:17:54.069062Z","submitted_at":"2026-07-20T16:08:24Z","title":"SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.18109."}