{"as_of":"2026-08-08T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6ea99a67b3fe530df5e03dbe6649b4e984cb9eaf5edeb73616ffcd0c300f6f8","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:02:34.050123Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:02:31.400913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:02:34.268817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"cited_work":{"arxiv_id":"2506.13971","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13971","snapshot_observed_at":"2026-08-07T12:02:34.268817Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","venue":"eess.AS","work_id":"66c1d58b-600b-4315-8451-0d74fe1cb352","year":2025},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.400913Z"},"links":{"cited_paper":"/paper/2506.13971","citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:6e92484a2b6b686ad3629f805134ad9c451c009e6c3715ecdbd9910b34842ff6","observation_id":"250380de-4773-4642-becc-ff26f686d791","resolution":{"observed_at":"2026-08-07T12:02:34.330862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13971/citation-record","integrity":"/paper/2506.13971/integrity","json":"/paper/2506.13971/citation-record.json","paper":"/paper/2506.13971"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.910706Z","title":"Although it is an es- sential medium for communication, it has not been sufficiently studied","venue":null,"work_id":"460f93bb-d797-4ab9-bb05-e5377ea6b8bc","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.108389Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:efa1a34fa170480cb16bfe4fe9fdd48721f939b2edad1cfab68cd2bb25ae48f3","observation_id":"14f71907-93c9-4273-8391-f6dec1e4d4e9","resolution":{"observed_at":"2026-08-07T12:02:34.913476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.903492Z","title":"While audio-based SSL has been widely applied in speech emotion recognition, multimodal approaches have only recently emerged [5]","venue":null,"work_id":"f36bbead-1eb4-47ea-9a14-f779e5b05b50","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.318650Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:59f9295487de879af7f224b883da62f37efa11130ef63b4b651314177bcaf28b","observation_id":"5beace89-127d-4171-87da-9ce7ded35caf","resolution":{"observed_at":"2026-08-07T12:02:34.906318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"cited_work":{"arxiv_id":"2506.13971","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13971","snapshot_observed_at":"2026-08-07T12:02:34.268817Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","venue":"eess.AS","work_id":"66c1d58b-600b-4315-8451-0d74fe1cb352","year":2025},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.400913Z"},"links":{"cited_paper":"/paper/2506.13971","citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:6e92484a2b6b686ad3629f805134ad9c451c009e6c3715ecdbd9910b34842ff6","observation_id":"250380de-4773-4642-becc-ff26f686d791","resolution":{"observed_at":"2026-08-07T12:02:34.330862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.896666Z","title":"Data split To analyze the impact of the labeled data ratio on SSL model performance, we partitioned the targeted clips data into 10 folds","venue":null,"work_id":"c5056351-921d-4132-ac40-b1df00fc4892","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.500877Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:6030c00150a1ce156d6e7f7e00a9f798cc947ad601537d9d1bc0ab4ab21e7841","observation_id":"9f3f8ed2-9ff6-4fb8-954c-66f9a1ebedc8","resolution":{"observed_at":"2026-08-07T12:02:34.899495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.888666Z","title":"They both outperformed SL counterparts at nearly every levels of labeled data in both ROC-AUC and macro F1 score by 1-4% for predicting Enjoy- ment or Fluidity","venue":null,"work_id":"aff918d8-f4ed-496b-a2ee-6c4a9d81e992","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.640676Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:1efe43888e891e0dccf38336bd25f69dc7dc75a0403f6e4632a95b3bbeec384b","observation_id":"3721b4df-c3fd-44c2-b52a-b7f439701f61","resolution":{"observed_at":"2026-08-07T12:02:34.892482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.881025Z","title":"We also demonstrated this approach gener- alizes to new sessions with different participants","venue":null,"work_id":"6db251e3-b200-41c3-a1f2-6f3484f0979f","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.734534Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:df3d8a92d85d26077f952ab37bc0397129ae2c2facb2eb5fe50ec311797654ce","observation_id":"4b42839b-4222-4946-852f-59f472b2a021","resolution":{"observed_at":"2026-08-07T12:02:34.883948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.873893Z","title":"are supported by NYU Discovery Research Fund for Human Health","venue":null,"work_id":"6fc0ad77-b706-4194-b6d1-49cca45e16af","year":null},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.860956Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:db52c2ee1941f0a1656053742cbf56a78c8334c4b65974e8da18d544a4213e12","observation_id":"0f6851fd-ef72-4fd4-9693-06c0175db9c6","resolution":{"observed_at":"2026-08-07T12:02:34.876763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.867045Z","title":"Sepa- rable processes for live “in-person","venue":null,"work_id":"d2d207f3-6b47-4ca1-a8b3-c6408885fd22","year":2023},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:31.969102Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:bbfe84a14ffb0887a3550a005192a095b286c4e4f94187061819fe58df496fd5","observation_id":"0216becc-1531-4bb6-a341-b865ff7dd3d3","resolution":{"observed_at":"2026-08-07T12:02:34.869522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.859671Z","title":"Perceiving others through a screen: Are first im- pressions of personality accurate and normative via videocon- ferencing?","venue":null,"work_id":"02da5520-15f3-4cc1-8379-b97b71dbb887","year":2024},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.089559Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:1a7a1ea781e7fada07b2ad9d393d380a71b89b56aff2fa8d5842b6818fe778be","observation_id":"d6a1ce21-fb37-41f4-b618-189606ad5a20","resolution":{"observed_at":"2026-08-07T12:02:34.862748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.852537Z","title":"Virtual (zoom) interactions alter conversational behavior and in- terbrain coherence,","venue":null,"work_id":"47675db1-09ec-4b2e-8891-c8a3151e7a08","year":2023},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.228978Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:a4c00bdc4084eb359701e1f668f6a672a24819a71718a18a426b31d9c6e60a24","observation_id":"9fb2e6b3-aa66-43f7-9561-daa65b84c27b","resolution":{"observed_at":"2026-08-07T12:02:34.855048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.844558Z","title":"The effect of video feedback delay on frustration and emo- tion communication accuracy,","venue":null,"work_id":"67ddf152-76a6-4ee2-bd7f-3df9fbfa190b","year":2011},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.313479Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:0a371754ca1730af4099519d289d092eba7582f0a789600aa72711b7947c41e5","observation_id":"7c8af8da-14d1-4bb1-8472-e1264d55b435","resolution":{"observed_at":"2026-08-07T12:02:34.847338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.836916Z","title":"A survey on the semi supervised learning paradigm in the context of speech emotion recognition,","venue":null,"work_id":"9d2b0c43-8447-425c-b8d4-73fff888d505","year":2021},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.435257Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:59fbbabc3c39732eb679a1aeb18c5660bcfffaab6ecb5c0dd8d7d781d29ad470","observation_id":"4d884b55-e1ab-4fe5-b2cf-73be7dc8d62f","resolution":{"observed_at":"2026-08-07T12:02:34.839435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.829216Z","title":"Combining cross-modal knowledge transfer and semi-supervised learning for speech emotion recognition,","venue":null,"work_id":"822cdfb9-5a4d-4b0a-aa68-0a2ebccd40de","year":2021},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.527665Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:d02d75ebcee61d4222778ec79f83e198448a4e2e0e4ad3f761e2960c7544f66b","observation_id":"0d0b9bfc-2c06-456a-9dc8-ab550a3f792f","resolution":{"observed_at":"2026-08-07T12:02:34.832068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.821329Z","title":"SMIN: Semi-supervised multi- modal interaction network for conversational emotion recogni- tion,","venue":null,"work_id":"72cf8a56-f11f-4b07-86bf-a5f5d76f8852","year":2022},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.647703Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:1d64c780fead057b91412f169fdb717e0474d10b616d2757b4b8d5a50744f631","observation_id":"712e1a3e-f380-40fa-8c8c-a310fe7cc07e","resolution":{"observed_at":"2026-08-07T12:02:34.824409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.813302Z","title":"Multimodal emotion recognition with vision-language prompting and modality dropout,","venue":null,"work_id":"91839632-017b-4c46-9a02-2915addb392e","year":2024},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.775464Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:e65051e6afa88e7daab06324ab3c6320794b279a4782b5af37e9220a8ab636ae","observation_id":"24621e28-0fef-4fdc-8502-08ac0926270d","resolution":{"observed_at":"2026-08-07T12:02:34.815933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.805410Z","title":"Focused or stuck together: multimodal patterns reveal triads’ performance in collaborative problem solving,","venue":null,"work_id":"cf288989-5245-425b-973b-c4fe6b3e8f8c","year":2020},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.850168Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:37a4271681852853bbc9ae2f01d9a6b60a1a5836ea338bfd53a3af5abf7d5797","observation_id":"a8a013e0-c416-412d-be93-08bf6fd8f456","resolution":{"observed_at":"2026-08-07T12:02:34.808608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3638251","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.094354Z","title":"QoE estimation of webRTC-based audio-visual conversations from facial and speech features,","venue":null,"work_id":"8b0e7b19-fd3b-48ea-8f70-1ad62bae2ac3","year":2024},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.906151Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:9d35dff0797a2e6ac597ff867a38ff735c8d97a7cdadabad4252f479dcd966ce","observation_id":"fb84d95b-bce3-4858-8a4c-18a3ddeda976","resolution":{"observed_at":"2026-08-07T12:02:34.193424Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.797613Z","title":"Multimodal machine learning can predict videoconference fluidity and enjoyment,","venue":null,"work_id":"47d164c5-416b-4dc3-be14-9a1c5e24717d","year":2025},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.960804Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:8a038951eb33c4ee970b7e2fbdf38a856fc6ec92122bfd1a315510a953a56dc2","observation_id":"a4041642-c90e-4244-a9e2-07fbc52f954b","resolution":{"observed_at":"2026-08-07T12:02:34.800732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.791240Z","title":"A survey on semi-supervised learning,","venue":null,"work_id":"54728e5d-f781-4759-a0de-86621384f90b","year":2020},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.011780Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:5167cbab274abd4399d1f4bec5de4bc8e0bc3bb62620365ac081f040733d3ac5","observation_id":"bced800f-af80-4f3d-98e8-698201cade0c","resolution":{"observed_at":"2026-08-07T12:02:34.793668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.784083Z","title":"Self-training: A survey,","venue":null,"work_id":"7d4254c7-c883-48a4-abee-99190f37a1a6","year":2025},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.085789Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:e3895429421a118a629f5da97039f7872ad8a2596525d114bce312fce3659ae7","observation_id":"864c3047-534a-4915-a15b-57963d720772","resolution":{"observed_at":"2026-08-07T12:02:34.786431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.778008Z","title":"RoomReader: A multimodal corpus of online multiparty conversational interactions,","venue":null,"work_id":"d80da345-f6b3-4c06-a99e-734485d2c624","year":2022},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.146074Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:80c87a80461c8d82918151da07371336f2a67380c420ab93db223b0f73190cce","observation_id":"8222a713-f43e-4f7e-b14a-22b717b03ba1","resolution":{"observed_at":"2026-08-07T12:02:34.780298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.771675Z","title":"Zoom disrupts the rhythm of conversation","venue":null,"work_id":"0fcf73e4-f40a-459f-bb65-da5b056b4755","year":2022},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.217943Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:5e1b4303942a328fdea2091c2bd0d31e196d011819e53e5605f3fd291f84fffd","observation_id":"13a6602f-8406-481c-89c1-fdc64f4a56af","resolution":{"observed_at":"2026-08-07T12:02:34.774060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.765420Z","title":"CNN architectures for large-scale audio classification,","venue":null,"work_id":"f896dd8c-0014-4af1-b9fc-c1ce960e1009","year":2017},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.290408Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:22b1308adc66805323e80beaa622f617b8b8162ccf89593949654f9b26b131c9","observation_id":"8c5eab4d-20f3-457d-84f6-10ab2b8fe3f9","resolution":{"observed_at":"2026-08-07T12:02:34.767947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.758669Z","title":"Openface 2.0: Facial behavior analysis toolkit,","venue":null,"work_id":"a845f090-5d03-46b4-b398-8da2321252c8","year":2018},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.344916Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:48a04e9a0dbeb8ac4fc21444f96417b2b17e3104d342a52cfee61c6f7fd97485","observation_id":"f6c6d7f2-b2e0-4ff8-92cc-1a616f275b80","resolution":{"observed_at":"2026-08-07T12:02:34.760837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.752352Z","title":"Sentence-BERT: Sentence embeddings using siamese BERT-networks,","venue":null,"work_id":"372bf590-8014-40ed-a0b5-1aef9177ebfc","year":2019},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.397811Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:fa5dcf8311659d4449f0323bd4cd8fe8bd71dbff6626480be1915c22236a7cad","observation_id":"aa76d053-f642-4314-a29a-1d5bb0f78f73","resolution":{"observed_at":"2026-08-07T12:02:34.754529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.483116Z","title":"Dawn of the trans- former era in speech emotion recognition: closing the valence gap,","venue":null,"work_id":"41b6770a-27cf-45ed-b8f2-e3079df44c0e","year":2023},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.014509Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:4ff1482f3b50754ca5d95a925c2c7a5460ab4863376e8432cbb17c2e08d06d2d","observation_id":"5207f3bf-45a3-4738-850c-1ca9d3ce2efb","resolution":{"observed_at":"2026-08-07T12:02:34.561797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.746375Z","title":"Unsupervised word sense disambiguation rivaling supervised methods,","venue":null,"work_id":"82115ad5-8f83-4518-8d30-9b2256ac1959","year":1995},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.516715Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:1cb0ae721f88452fd1665463d0e95cacf4d5810d2a23e77a06d4daeb518bf6f7","observation_id":"98963298-8a30-4102-856f-d280508ca078","resolution":{"observed_at":"2026-08-07T12:02:34.748580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.740796Z","title":"A new analysis of co-training","venue":null,"work_id":"44e6d793-a160-4d07-8187-bfbde61295f7","year":2010},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.572295Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:5335b6961ccbfe9b3f2dfab2d3c55d3981d5da8f4cd703adfb6998ba2a2753f4","observation_id":"03005f86-1240-4a87-b6d5-980d033a85a2","resolution":{"observed_at":"2026-08-07T12:02:34.742683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.734070Z","title":"SSLearn: A semi-supervised learning li- brary for python,","venue":null,"work_id":"9faeaa56-9c8e-4132-99ec-7de0e1a6c42f","year":2025},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.658316Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:efa3875c0b1c435acdc472ed42dd6c20f0c8bce0c4016119e12867cb1a0a9151","observation_id":"6f9e520e-f388-4c9d-8b4d-c8f99b3b2357","resolution":{"observed_at":"2026-08-07T12:02:34.736454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.726370Z","title":"Optuna: A next-generation hyperparameter optimization framework,","venue":null,"work_id":"4200d00d-fff5-465b-ad0e-f5fef4b8326e","year":2019},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.725720Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:6bcaa955b5599dc8c4616f923a4c206d7d0df76ab52e71fb1d628b301c15cb64","observation_id":"d77f066a-8e63-44e7-a549-ec43c0453d09","resolution":{"observed_at":"2026-08-07T12:02:34.729208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.719441Z","title":"3m- transformer: A multi-stage multi-stream multimodal transformer for embodied turn-taking prediction,","venue":null,"work_id":"0fa8cb77-1616-4f25-909d-c7c62869e796","year":2024},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.776863Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:fb62d5638a730368f3fef0558457b4d294d030847e6ac6b922d120420d2bbc23","observation_id":"c661bc39-f3d8-407d-8117-f1ed423aa00d","resolution":{"observed_at":"2026-08-07T12:02:34.722266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.712849Z","title":"Pre- dicting conversation outcomes using multimodal transformer,","venue":null,"work_id":"659f9322-2f6e-4a7d-b85a-f73ffdc9d92b","year":2021},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.858907Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:a16b783ea9d973cf03e0a400487afce0da37194118c2a8f1954e8d1a36ff1905","observation_id":"6cb51c3a-63e5-4a15-b7cb-7dc0c3f0187f","resolution":{"observed_at":"2026-08-07T12:02:34.715066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.678781Z","title":"Dyadformer: A multi-modal transformer for long-range model- ing of dyadic interactions,","venue":null,"work_id":"2fcc6c59-07fb-422f-a67f-071b87be90ce","year":2021},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.946759Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:3afdb778aee605da8665e1527f5c14106e1ceeec140d0e884282229c61963b1e","observation_id":"fe291e78-ff26-45ad-a4fc-7b6ce2ea9c1e","resolution":{"observed_at":"2026-08-07T12:02:34.708267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.410849Z","title":"CTNet: Conversational transformer network for emotion recognition,","venue":null,"work_id":"d543844a-0957-4003-979d-c14ae4b92803","year":2021},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.050123Z"},"links":{"citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:ac422868187225282a1aa4063793e61a3dc168306ce2074882346313ea7d438a","observation_id":"18b0d01b-1508-4a5d-b42d-74d9253f400c","resolution":{"observed_at":"2026-08-07T12:02:34.477575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T12:02:33.445605Z","title":"Available: https://arxiv.org/abs/1908.10084","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.445605Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.13971"},"observation_digest":"sha256:07e7edd355be3bc7112ef8b6a14b83b3192a143811f121bbfc5a8dfc8bc5a67b","observation_id":"70a47fcc-fc55-42ad-a552-f1b3cfd54226","resolution":{"observed_at":"2026-08-07T12:02:33.445605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13971","last_updated":"2025-06-01T01:09:08Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:56:13.367070Z","submitted_at":"2025-06-01T01:09:08Z","title":"Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2506.13971."}