{"as_of":"2026-08-10T20:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c958015de460e9a176eea9194925209ecfb2a6959de02945824b78971b9a78d0","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:34.901221Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:30.784001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T15:16:18.173817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-08-07T10:53:30.784001Z","title":"Smooth turn-taking enables coherent dialogue, preventing everyone from speaking simultaneously","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.784001Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:ee81424b8a182179f6389d293431df03a4fd86629ff1471dec1ecb608b5d0e8c","observation_id":"9de12901-6558-4484-b0f2-f1c58c483bb6","resolution":{"observed_at":"2026-08-07T10:53:30.784001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":"2506.03980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-07-09T15:16:18.173817Z","title":"Voice Activity Projection Model with Multimodal Encoders","venue":"cs.CL","work_id":"137ee5f4-6e4a-48ca-abf3-b3fa511446e7","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:76320121af775be943ec4f08f640eb1af430fa020978d358623292045a5bcfdd","observation_id":"470d4985-fcdd-40ae-960d-58c68db749cc","resolution":{"observed_at":"2026-07-09T15:16:18.175063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03980/citation-record","integrity":"/paper/2506.03980/integrity","json":"/paper/2506.03980/citation-record.json","paper":"/paper/2506.03980"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-08-07T10:53:30.784001Z","title":"Smooth turn-taking enables coherent dialogue, preventing everyone from speaking simultaneously","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.784001Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:ee81424b8a182179f6389d293431df03a4fd86629ff1471dec1ecb608b5d0e8c","observation_id":"9de12901-6558-4484-b0f2-f1c58c483bb6","resolution":{"observed_at":"2026-08-07T10:53:30.784001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.987368Z","title":null,"venue":null,"work_id":"d130a792-53a1-4015-a378-377b3d71399e","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.879347Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:79d30214a83db7c77eb6e65206a05548a53bdf3602a7dcac75aa7a604ece01e8","observation_id":"73b51346-a3ec-4558-a0b3-360959c5f71a","resolution":{"observed_at":"2026-08-07T10:53:43.054931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.855081Z","title":"Unlike Onishi’s multimodal model, we in- serted a pretrained encoder for facial images instead of action units","venue":null,"work_id":"41dd3348-8f38-45f3-b61c-b5462b0faece","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:30.968030Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:2d62c734d6312a712eca16601661ee5d975141d6fefd3fe1d8da8149eda29ecf","observation_id":"aa716f32-312b-415a-a2b2-ae805ea34828","resolution":{"observed_at":"2026-08-07T10:53:42.912586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.719538Z","title":null,"venue":null,"work_id":"8a3a2b75-e9fd-4a6a-b68b-f6d2b17480cc","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.049890Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:0888a4e42d45613118e2e25ee724159a1178b0c2cdaaf96de9b2eaf3884193ca","observation_id":"c6cd6bf3-e16e-41ee-9126-6c918ecce3f2","resolution":{"observed_at":"2026-08-07T10:53:42.792038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.544714Z","title":null,"venue":null,"work_id":"ec1df38d-7f54-4aef-85c5-d7a4f809cc0b","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.162124Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c848546a34462d3d6c26c11fac468d0c3a12a0a46f66afa5d9488b5a73991056","observation_id":"224039b8-c633-4b71-a07f-f0d11163178b","resolution":{"observed_at":"2026-08-07T10:53:42.629601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.395356Z","title":"Onishi’s approach involved merging user signals for each modality sepa- rately and then fusing across different modalities","venue":null,"work_id":"5e734ad2-3696-409d-8804-01b2686e2811","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.240357Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:b6a6cf4286a025f64ba6d3c5e1e966c530952b3bfe1c19cc59214a60118aeb0f","observation_id":"4cdeaaba-ed8d-459b-bdc4-8419da09eb7c","resolution":{"observed_at":"2026-08-07T10:53:42.446772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.252193Z","title":"Dataset: NoXi We used the NoXi multimodal dataset for our experiments [37]","venue":null,"work_id":"496f40e3-c3f6-4c7f-974f-fc6c44d4075f","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.302301Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:37f6ff6eff0f19539c341dbb9078125d7ed24bd7b33f89fff785d7114757383e","observation_id":"3ed24270-7e68-43f5-96e1-a5766682c055","resolution":{"observed_at":"2026-08-07T10:53:42.334883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:42.098867Z","title":"For SP and BC, our models (Proposed1 and Proposed3) outperformed the baselines, where the differ- ence lies in the use of facial embeddings from the pre-trained encoder","venue":null,"work_id":"5d3da5a0-7ee5-4d7c-b0d2-e9be4fbf5190","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.386731Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:61e2f651dc891b336f46e00756ee7b554028bcbd791302e38800a40e23af67db","observation_id":"780aeee2-700b-4651-a456-3398cd8e9303","resolution":{"observed_at":"2026-08-07T10:53:42.153637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.908407Z","title":"By incorporating a face image encoder, the proposed models demonstrated competitive or even superior performance compared to the multimodal state-of-the-art (SoTA) models","venue":null,"work_id":"cf0993d6-6d03-4622-b800-a24fe8dcf4d0","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.455482Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d81fde6c346eb91637aada00d956e1a728bcb624b58f079aa62cdd9cc374f8c0","observation_id":"60c487df-7565-4fb3-ade1-fefc984fdf05","resolution":{"observed_at":"2026-08-07T10:53:42.009648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.790911Z","title":null,"venue":null,"work_id":"a1ca91d3-178f-4c3a-81de-76a8e7b6d85c","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.536151Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:5b41f905dff173eb761facefe28c0d9da9faf8611d5db00b1e03fce355650be3","observation_id":"eb5de9e2-133c-41a7-8d17-4924acea615d","resolution":{"observed_at":"2026-08-07T10:53:41.838076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.618881Z","title":"A simplest systemat- ics for the organization of turn-taking for conversation,","venue":null,"work_id":"e35ed00c-1596-479a-b35c-d177d7bdc27f","year":1974},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.603372Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c6cfaf6f97eadb5df7c9eb6c262f1eda6f0e73b449aae644b62dc480e331c9d0","observation_id":"62bce116-9f4b-44ee-9713-047f6d3fcf15","resolution":{"observed_at":"2026-08-07T10:53:41.696757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.455354Z","title":"Turn-taking: A critical analysis of the research tradition,","venue":null,"work_id":"ea0afa2e-c64c-453b-ab58-b68d55beed8a","year":1990},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.672711Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:2d7bd8f96c46d0487c752ed795690e482d0eaf31fb3267077919aff5161feb85","observation_id":"5b02f3d6-2f7a-4823-a7dd-4c68fde28c3d","resolution":{"observed_at":"2026-08-07T10:53:41.521561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.339905Z","title":"Some signals and rules for taking speaking turns in conversations,","venue":null,"work_id":"31935414-63e9-4927-b0e4-d0c21c8ec106","year":1972},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.768806Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:a6e0d20562fac3699c86a34f2096f14cf4b403dda4421c083c9b7e50525efc06","observation_id":"591fbe38-ee34-4ebf-9c78-a272121bf8a0","resolution":{"observed_at":"2026-08-07T10:53:41.371958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.196219Z","title":"Interactional units in conver- sation: Syntactic, intonational, and pragmatic resources for the management of turns,","venue":null,"work_id":"94251af7-8cf8-4555-a441-0a27363e4369","year":1996},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.848267Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:b4bf2945f93cb8b94981b2cfaa96d6885dcdb0b462a566f52a225614ef32993f","observation_id":"aec0d1ca-d0be-4ae3-ad90-f445f9f4a695","resolution":{"observed_at":"2026-08-07T10:53:41.256020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:41.055875Z","title":null,"venue":null,"work_id":"037e6c9c-5027-4989-8a21-0c14c2052e80","year":2019},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.931068Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:0d778d36c2542aaba22c8cb6a38613489a790df06de9e093aff16c320d2be43f","observation_id":"e1f26d21-f463-40f4-91fc-2084d25146de","resolution":{"observed_at":"2026-08-07T10:53:41.114513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.939908Z","title":"Using uh and um in spontaneous speaking,","venue":null,"work_id":"f0225a68-7d3f-4997-b221-ed0826727da0","year":2002},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:31.990975Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:8f426534b8123ae6dfc4579ce1f347e7a316b3cbe3674c215a12bc0ab7bcc7bd","observation_id":"cd7c379f-dd7d-47c8-a25b-bde9899b98af","resolution":{"observed_at":"2026-08-07T10:53:40.996352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.791953Z","title":"Using prosodic clues to decide when to produce back- channel utterances,","venue":null,"work_id":"5cadde55-f2f2-414a-b5d2-58fc8effb5c7","year":1996},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.071262Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d98c803b046b190bbd83170de9a7775a8d4565a2ed10ede4b234d915520fb6b4","observation_id":"09b69a46-189d-4ea2-83fb-766c2db89b85","resolution":{"observed_at":"2026-08-07T10:53:40.844132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.664084Z","title":"Nonverbal behaviours improving a simulation of small group discussion,","venue":null,"work_id":"59cce04c-e589-4916-91d4-3608fc2c06b2","year":2003},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.132742Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d4c2d31380b25dee054ee6889afd7520f4812b65d616891dec9a7f337af4d71d","observation_id":"ccd90798-8833-4eb4-be36-b1610fea83a1","resolution":{"observed_at":"2026-08-07T10:53:40.712473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.522085Z","title":"Sustaining interaction dynamics and engage- ment in dyadic child-robot interaction kinesics: lessons learnt from an exploratory study,","venue":null,"work_id":"88b6d64b-ae27-452e-987b-92b1211e7951","year":2005},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.220226Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d43b465aac3fe689172caa56f13a24b6e33f6afc546220a3979f71e5c643d9df","observation_id":"13f5be9a-d41e-4f27-8a59-05e5a9ac65c3","resolution":{"observed_at":"2026-08-07T10:53:40.564372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.364222Z","title":"The effects of interrupting behavior on interpersonal attitude and engagement in dyadic in- teractions,","venue":null,"work_id":"3536d69a-85d5-4adf-a462-80496e57631a","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.302198Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c9fb7bf31aa21e4832ad4db83330595bac67e21ffe92998043804c790e818ee1","observation_id":"63bf7315-b13f-4021-ac0c-781f5dc7fbcb","resolution":{"observed_at":"2026-08-07T10:53:40.417748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.254119Z","title":"Now or when? interrup- tion timing prediction in dyadic interaction,","venue":null,"work_id":"69d268df-023d-4e77-9891-fed8671c4b31","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.384924Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:ef888e518be9f36c968a2f229f248cb14acbdceedb7dfe32f3e3275ae70ce7f0","observation_id":"d6ffe9f2-4f0a-47e6-92d8-2091d2c9dec8","resolution":{"observed_at":"2026-08-07T10:53:40.299939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:40.078213Z","title":"How turn-taking strategies influence users’ impressions of an agent,","venue":null,"work_id":"837b069f-9f79-41f7-920b-9987b77daa8c","year":2010},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.475213Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:61607d1278d6a4b257f7d4c5118f3ac1cb7ae2065bcbe019ed444620882d94d5","observation_id":"f42f06c1-b3a3-4cfd-bf38-f36ac0dae25d","resolution":{"observed_at":"2026-08-07T10:53:40.132579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.956416Z","title":"Timing in turn-taking and its im- plications for processing models of language,","venue":null,"work_id":"96b8c0e4-46da-4f81-a7bb-766bca1238d5","year":2015},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.568382Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:7e8fbe4ac9388d0fd1d7c94cf2556ee8dd3d00727aecea70753e2b8e693ec620","observation_id":"62270099-7a5e-4217-afb9-d21fc7f21aa8","resolution":{"observed_at":"2026-08-07T10:53:40.014896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.838065Z","title":"Timing in conversation,","venue":null,"work_id":"50cb6d6d-1bde-4822-8fd9-a162571ef308","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.636080Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:49ccaa97eeea73d7f7a69311c2504ef9e6778cae066498bd1563bbbaf708293c","observation_id":"bb06fffc-88c0-48bf-8da3-211339adf5c2","resolution":{"observed_at":"2026-08-07T10:53:39.863966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.637394Z","title":"Can I finish?: learning when to respond to incremental interpretation results in interac- tive dialogue,","venue":null,"work_id":"63663e23-a15a-4ab6-9a12-a17be640ed52","year":2009},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.724770Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:789d926ba44031220cf2eff0a2aff5b719434a2a98eefb742e0fbdb963acc228","observation_id":"df526a09-03c7-476f-95ea-b7f86eab929f","resolution":{"observed_at":"2026-08-07T10:53:39.721820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.451844Z","title":"Investigating fluidity for human- robot interaction with real-time, real-world grounding strategies,","venue":null,"work_id":"2a1887ac-acc7-46a7-9406-ce04d2f17382","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.843858Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:735650a80f51bca9f2b726b20294b5697e9aebefe13e116d72d8bee1a51f5029","observation_id":"4da0c1f6-3c35-4047-bdf6-26c2e15dce5f","resolution":{"observed_at":"2026-08-07T10:53:39.546358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.286663Z","title":"Attentive listening system with backchanneling, response generation and flexible turn-taking,","venue":null,"work_id":"670b0b4e-7a2f-4c82-8973-27412c431f97","year":2017},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.909303Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c6c024b960331a51d58b451486bd81d682b913170ed749c1d75e4af2a1abfa5a","observation_id":"0c39117f-2ccc-46af-b5d0-f9a8e5f281eb","resolution":{"observed_at":"2026-08-07T10:53:39.388384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:39.091369Z","title":"V oice activity projection: Self- supervised learning of turn-taking events,","venue":null,"work_id":"5b0fc05f-31d9-4beb-b0e6-d2449df90d6c","year":2022},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:32.990781Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d990007e79024b3d777eaf596239514b18c7e26fa46e1e5912b4754aff4924be","observation_id":"4397cd86-ad7e-4d7a-98d4-0b499497769d","resolution":{"observed_at":"2026-08-07T10:53:39.187792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.955550Z","title":"Pre- dicting next speaker and timing from gaze transition patterns in multi-party meetings,","venue":null,"work_id":"8f174574-f430-4b2d-b4f8-d10e12f6ee43","year":2013},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.117340Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:01c375afae00e26f61f62fd057fe4c0863e0249e0a524ef308b0f600efb030ec","observation_id":"88e17781-a09a-4660-8764-15a4c9979cef","resolution":{"observed_at":"2026-08-07T10:53:39.016839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.808128Z","title":"Predicting turn-taking by compact gazing transition patterns in multiparty conversation,","venue":null,"work_id":"c71e967b-0ec2-463b-8a38-7eb2e31be87c","year":2018},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.186043Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:887a7ecaa738c4ad60a0757d86442843896f2180524cd0e74b3fcda2c4e876be","observation_id":"72879ccf-5500-4aeb-9098-a3004ce9138c","resolution":{"observed_at":"2026-08-07T10:53:38.872661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.634716Z","title":"Prediction of who will be next speaker and when using mouth- opening pattern in multi-party conversation,","venue":null,"work_id":"cab883bf-b628-4f60-8eaa-70411595c3f1","year":2019},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.270468Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d1d14f2b30ccac4d626dd2a215c4ff087e434b3a92013a20b18bce0d5e380338","observation_id":"f9c1df9b-1a7d-4722-a582-d1657e5baa05","resolution":{"observed_at":"2026-08-07T10:53:38.700880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.501858Z","title":"Multimodal voice ac- tivity prediction: Turn-taking events detection in expert-novice conversation,","venue":null,"work_id":"0bd63208-b306-4536-b4a6-f014767e2805","year":2023},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.345041Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d7bb9e4379fb37395f09aeaac91952eb9d4a3c09b22154eb7bd2018e07f983a7","observation_id":"cffd3c23-bf87-4e5b-a3c6-4e63e3116661","resolution":{"observed_at":"2026-08-07T10:53:38.574119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.332020Z","title":"Turn-taking and backchannel prediction with acoustic and large language model fusion,","venue":null,"work_id":"b2ff1c3c-d737-4c11-86d4-57c367b25b07","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.427059Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d209a77d613933d795917f43b6e050e647a221fc0148f4861835737cc5dfcc47","observation_id":"27f3612d-ddcc-497f-9b80-59a3d55a0de0","resolution":{"observed_at":"2026-08-07T10:53:38.412562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.200391Z","title":"Predictive turn-taking: Leveraging language models to anticipate turn transitions in human-robot di- alogue,","venue":null,"work_id":"fca6d5d0-3db9-4e29-a6d1-e13088794bfe","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.524622Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:d3b101542ba1b558f9c500a4a44d84662f4694f0b54c1c234a2f80c19ed215c3","observation_id":"ee2159a5-e41e-429c-b0ab-71b5bfd41980","resolution":{"observed_at":"2026-08-07T10:53:38.272095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:38.058003Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":"227f5a41-2262-49b7-aeb3-777c51feba37","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.597594Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:e017f12ece773b83fc34d217f83bd8643892e9a351b056375e7834997e9b3ed0","observation_id":"319c46e6-58d3-46f3-b227-99ef7960d4b4","resolution":{"observed_at":"2026-08-07T10:53:38.118055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.888283Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"ce1af014-3f72-424d-8ca8-9164e1ec45c4","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.663036Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:9e0afb499873813b7ea7d2908f1b952e3e588425ce5f87bab411e8b3ccdea4d9","observation_id":"38d5a649-549b-4ec6-bb89-2e1661e190ac","resolution":{"observed_at":"2026-08-07T10:53:37.955757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"answer/1527489","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.368131Z","title":"[Online]","venue":null,"work_id":"88a79299-c7e3-40af-adc8-939d407eae9b","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.737389Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:7d9ce04c96b7af9f6b01e910210c80ad267deb3bc98cf73f3ccdeada8ca64b9a","observation_id":"ca140c6e-e660-48da-9588-d30903dab38a","resolution":{"observed_at":"2026-08-07T10:53:35.452694Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.729216Z","title":"[Online]","venue":null,"work_id":"8a293106-7828-4387-8a3f-d7ccf64667a4","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.808721Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:2eb7d3348fa239f7cab337b22d0a1d82768869bcda172e49a837204e6e16bc90","observation_id":"ec01cbc1-9b8f-4645-8879-73d67df253f6","resolution":{"observed_at":"2026-08-07T10:53:37.793002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.524736Z","title":"Real-time and continuous turn-taking prediction using voice ac- tivity projection,","venue":null,"work_id":"b7d72d76-c9a4-41a6-997d-d2eadde4c1d0","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.886558Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:87746eb1c1b9dbda66096d7bb98a2df034e9faf2111cfed8e67f760db67aaefe","observation_id":"881446a4-fe91-4cae-9141-96ada48bfbe2","resolution":{"observed_at":"2026-08-07T10:53:37.615970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.359785Z","title":"Multilingual turn-taking prediction using voice activity projection,","venue":null,"work_id":"72fa665e-8517-4cbc-80ea-aee3c78216fc","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:33.981132Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:44330cd1d1e00721fe4dba3c83059d8ae5bf7529e9582213b7c38f5033c64278","observation_id":"3fc479d7-856d-45ad-b697-8ddd0a9c8624","resolution":{"observed_at":"2026-08-07T10:53:37.419432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.216015Z","title":"How much does prosody help turn- taking? investigations using voice activity projection models,","venue":null,"work_id":"45acf2f8-1636-4048-9037-7d28967c9dc4","year":2022},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.064405Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:dc3bbb220b43d82e8e0a98d177d030a5155854f4ae6589bc17a03e8007b0a3cf","observation_id":"e17c12c0-735c-4ac2-b140-e657a73e465a","resolution":{"observed_at":"2026-08-07T10:53:37.283172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:37.054926Z","title":"OpenFace: An open source facial behavior analysis toolkit,","venue":null,"work_id":"851cf791-4a17-425c-84da-cfd3851a9cda","year":2016},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.136834Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:23210e02f299175a0ff5a4de3d728fbc63e3534df2421ea0593b2cd26623f3ac","observation_id":"2e2e21d0-e993-4a8e-a422-81c281be1e99","resolution":{"observed_at":"2026-08-07T10:53:37.094480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.908853Z","title":"Open- pose: Realtime multi-person 2d pose estimation using part affinity fields,","venue":null,"work_id":"cdd3baf3-20c9-42ae-9614-bd6eec80d173","year":2021},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.203584Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:4c26b31147a1ae720077d274eaba3d8240e20b098a9a1b8a82b01308a746bcde","observation_id":"0a9cae1f-8d18-410a-888c-8affc0869fb9","resolution":{"observed_at":"2026-08-07T10:53:36.970605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.739294Z","title":"Former-dfer: Dynamic facial expression recognition transformer,","venue":null,"work_id":"6b866412-e44a-48e4-8413-cfba74017713","year":2021},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.268089Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:c9e8d0313f50901f438375b9a7b98734c339fd78ff1ffc34d7c88d668b0e8062","observation_id":"e6fd51c1-dc02-4a73-b9ac-86fccdf24ffa","resolution":{"observed_at":"2026-08-07T10:53:36.817813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.520850Z","title":"Unsu- pervised pretraining transfers well across languages,","venue":null,"work_id":"686b89ff-e47b-43f0-b4a1-aab8f3b9cd42","year":2020},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.338299Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:94fa8a545e12313fa23abab0d331cd44eb5ccd691b7b98b31714d95283d545e2","observation_id":"4d281b4e-0199-4e08-b775-6c119c49253e","resolution":{"observed_at":"2026-08-07T10:53:36.605534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.386645Z","title":"Dlib-ml: A machine learning toolkit,","venue":null,"work_id":"1a9b7cb8-6727-408a-8b06-9f8656d95d73","year":2009},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.416269Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:1b334ac76073fa5511e2274e2a36e709c7870642af57e60e313f487b410fb175","observation_id":"55d37418-757f-4d48-ba23-cd3102fd6f51","resolution":{"observed_at":"2026-08-07T10:53:36.456539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.217780Z","title":"The NoXi database: multimodal recordings of mediated novice-expert interactions,","venue":null,"work_id":"a1eed5d8-af76-4a16-9970-fb72387b7e60","year":2017},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.513926Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:db7afa6daf57332d685b0778f3ac97ab254b375fcebf5221a31c55f0408789b2","observation_id":"0f56658d-9e42-4ba9-923b-fac07bf14a51","resolution":{"observed_at":"2026-08-07T10:53:36.282903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:36.077382Z","title":"PyTorch Lightning,","venue":null,"work_id":"90077add-c826-4e40-a16e-60ebd8013872","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.593139Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:49179eafa634aa55f26f0461138ef192b2d004107f748939d6952f961d55a0ed","observation_id":"4cdced7e-395a-4d45-a249-982e7f1df638","resolution":{"observed_at":"2026-08-07T10:53:36.137530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15327973rlsi2803","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.091724Z","title":"Discourse as an interactional achievement iii: The omnirelevance of action,","venue":null,"work_id":"0fcf4e53-7eba-42f9-bc3d-3b599662166b","year":1995},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.751806Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:9cae0ff9cfb09bf7969a55c99dfadcf748026bb5eacc6ef15a42b29005c39b2a","observation_id":"73512c0f-2b7e-4b8b-9385-91b48365d77a","resolution":{"observed_at":"2026-08-07T10:53:35.150121Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.752652Z","title":"Between and within: Alternative sequential treat- ments of continuers and assessments,","venue":null,"work_id":"d43a7f93-d204-4f26-a227-4d1e8b6b3559","year":1986},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.819433Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:e74b6397fa5dcd85f80840df925d631e59efa0d80ad88b2980831e4b7948ad4c","observation_id":"eda6959a-4dde-4ea0-ab68-e3e9ac2710a4","resolution":{"observed_at":"2026-08-07T10:53:35.828855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.596897Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":"63a17816-bc2d-44e7-8aa9-3fac2d3f6a7d","year":2024},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.901221Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:6c867f1bd3023f703f6b8e4a405dc5f2501d72e34790eab496465f5f317329ec","observation_id":"5ab26f48-cf14-4575-a333-2892af7ef0f5","resolution":{"observed_at":"2026-08-07T10:53:35.653190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:53:35.933147Z","title":"Available: https://github.com/Lightning-AI/ pytorch-lightning","venue":null,"work_id":"774e168a-44e7-442c-882c-24c84ba71a12","year":null},"citing_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:34.665269Z"},"links":{"citing_paper":"/paper/2506.03980"},"observation_digest":"sha256:573c862ec073efe2f10052be747e8d9ebdd1fa49960274e3598fe016d36adb36","observation_id":"fba6514b-15e3-4dd3-90ba-c469c37b185a","resolution":{"observed_at":"2026-08-07T10:53:35.986850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:47:45.643040Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":44},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2506.03980."}