{"as_of":"2026-08-06T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e3f1201e56ba89103819b211a50a5fca27e4869d2bbb49e131d2a1b1010d07a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T15:07:52.715880Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07294/citation-record","integrity":"/paper/2607.07294/integrity","json":"/paper/2607.07294/citation-record.json","paper":"/paper/2607.07294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.351551Z","title":"A Simplest Systematics for the Organization of Turn-Taking for Conversation,","venue":null,"work_id":"a2ea2e09-eb82-4f40-a6b4-5356354fb638","year":1974},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:a1633623f03e18072590cb8692dd379d9fe2ac2de36e68ecc6ed888d411d5179","observation_id":"0282f24d-3551-4817-bef1-7b320ee434d1","resolution":{"observed_at":"2026-07-09T15:16:18.352789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.357253Z","title":"Palinko, L","venue":null,"work_id":"02d16668-9d81-49ef-929b-05264ccaf614","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b5360d8f793253e5b1f0dcb597d39c2de4eed87da8b46131ee6a1ace801aea88","observation_id":"f9129915-712f-4024-8910-f406a887bc7c","resolution":{"observed_at":"2026-07-09T15:16:18.358292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.389544Z","title":"Towards improving turn-taking in social robots using Visual-Only V oice Activity Detection in multimodal dialogue systems,","venue":null,"work_id":"9c685621-e866-4e53-b0a8-e7cac1793e84","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:d60ef28b7f630516e9481ebcaa0df5c0a962c667a80f5415c8ba23220b7cee34","observation_id":"52b7dab9-f39a-45be-b973-b72343cca828","resolution":{"observed_at":"2026-07-09T15:16:18.394045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.366623Z","title":"Design of Social Features for Robot-mediated Cross-cultural Interaction,","venue":null,"work_id":"0c96326c-0e03-4ceb-b5d2-383b70d7f1f7","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b8534acb9bbce8939ed6ed6089dd560f32f21ba5d20f7dd0f59987f978eb90ac","observation_id":"b62a8dfb-9685-4f45-81b0-e8c88c2bdb24","resolution":{"observed_at":"2026-07-09T15:16:18.367807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.374631Z","title":"Haru in the Care Network: Stakeholder Perspec- tives on Privacy with Social Robots in Pediatrics,","venue":null,"work_id":"d7e2c007-a26e-4e00-8998-644903e0d43f","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5fa2e222dc7bb12b7deeca5c1510e3293e419bc063088138b5348f27a3111194","observation_id":"87a5e57a-9755-4805-aaad-905ec97166d4","resolution":{"observed_at":"2026-07-09T15:16:18.376031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.344289Z","title":"Building Friendships Across Borders: The Role of Social Robot Haru in Children Group Communication and Con- nection Development,","venue":null,"work_id":"7353cc21-0709-4d3e-a1fe-6e1b2401c371","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:95160ad1adce8f567e52235be2396601d1dcc88383e3d40e07fcf4f58bda5cb5","observation_id":"ea58cff9-99f7-4cdd-bba2-b13bef42da12","resolution":{"observed_at":"2026-07-09T15:16:18.345600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.361283Z","title":"Multimodal Transformer Models for Turn-Taking Prediction: Effects on Conversational Dynamics of Human-Agent Interaction During Cooperative Gameplay,","venue":null,"work_id":"8b15a164-bf30-462f-ba8a-16c43b8d2818","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:78395470720972dde40f34e3bd457222da6d136050274e8553567fee44a8f234","observation_id":"db4b203d-461d-42bc-b452-13de60bc5d7d","resolution":{"observed_at":"2026-07-09T15:16:18.362684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.359037Z","title":"When and How to Express Empathy in Human-Robot Interaction Scenarios,","venue":null,"work_id":"60ded721-8965-4529-91ae-e7f176f6a0c3","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:6fb5d017d3fbe2f49bc6c23c6dbdbaa782b80c5ff06587720086bc431c452fa3","observation_id":"68bb76cc-eb5f-459f-88f5-3ad4ac8d6b12","resolution":{"observed_at":"2026-07-09T15:16:18.360215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.178920Z","title":"Visual Cues Enhance Predic- tive Turn-Taking for Two-Party Human Interaction,","venue":null,"work_id":"a3df7aef-43e0-477f-8a61-b2c78e2eb068","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:68154507c543cf509374c50325fc5dd2bc873cbd4fdbae24d8cc38a16b393024","observation_id":"73e92f35-0e57-4eba-8dd0-72374184aaf6","resolution":{"observed_at":"2026-07-09T15:16:18.180515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.381719Z","title":"Turn-taking in Conversational Systems and Human- Robot Interaction: A Review,","venue":null,"work_id":"90f2f264-0268-4b9e-8fe5-7406e00e6bef","year":2021},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:e8e314f5fa19cf4614bdc4f14245ec1a9cafec5a2c55863389b0b6977a8242ae","observation_id":"fa1a4aef-7966-4b6b-a468-8273d5052685","resolution":{"observed_at":"2026-07-09T15:16:18.382925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.355397Z","title":"Data-driven models for timing feedback responses in a Map Task dialogue system,","venue":null,"work_id":"642ed8f7-660c-43ff-9167-ccce08048a5e","year":2014},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:aa70b5a34a103d31eb44ec50aa38c460f23cd84b7d1b0e70bbb2006ad99d3769","observation_id":"9466d6d4-c7cf-44d1-8baa-558880af1735","resolution":{"observed_at":"2026-07-09T15:16:18.356589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.401827Z","title":"On temporal aspects of turn taking in conversational dialogues,","venue":null,"work_id":"fa287ba3-d7de-4646-be90-a8d56d2f56b2","year":2005},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:78931aaf77f4782c65a9a26d4a2041197a32b9f0e46a642cfb04cd16bb617d1e","observation_id":"147ab622-c0ef-4294-83e1-e929682a9059","resolution":{"observed_at":"2026-07-09T15:16:18.403311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.383628Z","title":"Turn-Taking Modelling in Conversational Systems: A Review of Recent Advances,","venue":null,"work_id":"60e24beb-5ee2-4267-ab4b-921dfaeb3e1e","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:8dd45d6694879551c1a18a124fabdc1c05e402bc369a423750f4086629b1ddd1","observation_id":"5a3cfe38-9e60-465c-8841-10c1474ca5f6","resolution":{"observed_at":"2026-07-09T15:16:18.386459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.387140Z","title":"Pauses, gaps and overlaps in conversa- tions,","venue":null,"work_id":"01eab645-e383-4004-8717-f32ffdac78aa","year":2010},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:062373f9cbefd538bfe2271b75134c3cba54f759d00fa19738e9def108ab9a5c","observation_id":"ad296677-e421-4ec5-a49f-bad88b7a66d7","resolution":{"observed_at":"2026-07-09T15:16:18.388335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.399465Z","title":"Timing in turn-taking and its impli- cations for processing models of language,","venue":null,"work_id":"0ab245ba-2c30-4954-b776-e81b51b5b8ee","year":2015},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:87daf64e6126121ac55f9b0b5128fbefcdd73eb5b3b68ad38ecb11de119743d6","observation_id":"1782f32b-0171-4208-a4ca-efc617d8e4a3","resolution":{"observed_at":"2026-07-09T15:16:18.400964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.379078Z","title":"Timed picture naming in seven languages,","venue":null,"work_id":"93fa5f86-cfef-442f-91d4-5fcba65a7c58","year":2003},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:15b40531935df1371d4a34d04fa3c975a89414463a893258d638b9ac8557d480","observation_id":"52335817-0e8d-4365-930c-919e49bd33b4","resolution":{"observed_at":"2026-07-09T15:16:18.381221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.375882Z","title":"Multimodal Turn Analysis and Prediction for Multi-party Conversations,","venue":null,"work_id":"33551fa8-905e-4b69-b696-8d3ca2a6e25a","year":2023},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:97a5cb2f9a17ad59c7491d9c8fe3b74bc253a30172a62c5b73aba3e346a54b53","observation_id":"a5cecb58-38eb-49ad-a568-5d9f1e1f671d","resolution":{"observed_at":"2026-07-09T15:16:18.377072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09812","last_updated":"2022-05-19T19:16:45Z","snapshot_observed_at":"2026-08-04T00:11:32.581547Z","submitted_at":"2022-05-19T19:16:45Z","title":"Voice Activity Projection: Self-supervised Learning of Turn-taking Events","version":1},"cited_work":{"arxiv_id":"2205.09812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.09812","snapshot_observed_at":"2026-07-09T15:16:18.176205Z","title":"Voice Activity Projection: Self-supervised Learning of Turn-taking Events","venue":"eess.AS","work_id":"568c50a9-34e4-4fd8-b188-73c782c6b7f7","year":2022},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2205.09812","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:9da52faa5280b55abaa61963e96c35602bc1aea467f33ec5fa20f9ec3f04a4cf","observation_id":"4bc0f3d5-efba-410c-8251-d83d4b2439f7","resolution":{"observed_at":"2026-07-09T15:16:18.178117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.373848Z","title":"Multimodal V oice Activity Projection for Turn-Taking and Effects on Speaker Adaptation,","venue":null,"work_id":"74400d35-f7bc-47ab-acb0-f1fb4aa93166","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:8c1fab9dafeda3dac4e308b14d6f24f9b29b4e10a44e0f11ee6ca687e6af279b","observation_id":"8ccd277d-0bec-4730-98fa-10db1f7dcc45","resolution":{"observed_at":"2026-07-09T15:16:18.375030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03980","last_updated":"2025-06-04T14:10:03Z","snapshot_observed_at":"2026-07-06T21:36:35.142284Z","submitted_at":"2025-06-04T14:10:03Z","title":"Voice Activity Projection Model with Multimodal Encoders","version":1},"cited_work":{"arxiv_id":"2506.03980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03980","snapshot_observed_at":"2026-07-09T15:16:18.173817Z","title":"Voice Activity Projection Model with Multimodal Encoders","venue":"cs.CL","work_id":"137ee5f4-6e4a-48ca-abf3-b3fa511446e7","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.03980","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:1acb8cec00ae9ec6e0d55b7afb1c7630f0577d32eabed913233bf75ab0ca5183","observation_id":"470d4985-fcdd-40ae-960d-58c68db749cc","resolution":{"observed_at":"2026-07-09T15:16:18.175063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12654","last_updated":"2025-05-20T06:59:31Z","snapshot_observed_at":"2026-07-06T21:25:56.796553Z","submitted_at":"2025-05-19T03:08:30Z","title":"Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual Signals","version":2},"cited_work":{"arxiv_id":"2505.12654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12654","snapshot_observed_at":"2026-07-09T15:16:18.185554Z","title":"Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual Signals","venue":"cs.CL","work_id":"938ecc02-c69d-469e-b869-f6d686888439","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2505.12654","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:2727bc56c4a28f5ed1443796512defcb6c1dbff46bfaa6526fda298265f79fa6","observation_id":"4ad90fe7-4bca-4639-8d5a-dc3befd6f0f8","resolution":{"observed_at":"2026-07-09T15:16:18.187022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.08454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.188248Z","title":"Behind the scenes: Mechanistic interpretability of lora-adapted whis- per for speech emotion recognition","venue":null,"work_id":"e8df674d-80e0-4ffc-a176-07bb417f5d85","year":2026},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:7866a814a5d31b10027ab33b4bfefdf25d0f24d6a5692cafa0a1a8191eee82f3","observation_id":"8e2c3d74-7b8b-46de-84b1-d06f7598c9ca","resolution":{"observed_at":"2026-07-09T15:16:18.189958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.379842Z","title":"GRPO- Guided Modality Selection Enhanced LoRA-Tuned LLMs for Multi- modal Emotion Recognition,","venue":null,"work_id":"a99d27bb-006c-49ab-acf0-ff92f88de7ba","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:320090b651bebea9bf1e9e875664662feb45ae69c4052ff600a3c047527715a3","observation_id":"81a4e9cf-4fcc-43ee-8751-69b055435dd9","resolution":{"observed_at":"2026-07-09T15:16:18.381415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.395021Z","title":"LoRA- Whisper: Parameter-Efficient and Extensible Multilingual ASR,","venue":null,"work_id":"fec31fe2-de6a-4532-911f-2edd84c86afa","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:e6ec26d346c3a3d8c640778107bd8a112459ed7020557575994bf652f1a30a4c","observation_id":"5ffdd3e1-feae-44d4-8b2e-af516f9e1ffa","resolution":{"observed_at":"2026-07-09T15:16:18.396659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-07-06T21:43:31.210133Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"cited_work":{"arxiv_id":"2506.14427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14427","snapshot_observed_at":"2026-07-09T15:16:18.188094Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","venue":"eess.AS","work_id":"db36c197-ca04-42f0-bb53-7e219303e575","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.14427","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:8f558fa485f55751150ec5cad084b4e44f6512b1b6d9a32b079c827b8c039783","observation_id":"627f9364-7480-480c-a8e3-e381cc071047","resolution":{"observed_at":"2026-07-09T15:16:18.189364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.370237Z","title":"Multimodal Large Language Model with LoRA Fine-Tuning for Multimodal Sentiment Analysis,","venue":null,"work_id":"a263572a-ce66-4b87-8f22-cf69e15c6907","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5f9351c27d466fb5aec56604772bb0067020c248cf0d70554392c6bab7105656","observation_id":"60165d4b-3bf1-426a-abff-8715198e1dab","resolution":{"observed_at":"2026-07-09T15:16:18.371418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09617","last_updated":"2024-06-13T22:52:07Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T22:52:07Z","title":"Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection","version":1},"cited_work":{"arxiv_id":"2406.09617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09617","snapshot_observed_at":"2026-07-09T15:16:18.190721Z","title":"Multimodal Large Language Models with Fusion Low Rank Adaptation for Device Directed Speech Detection","venue":"cs.CL","work_id":"00266656-3e59-4ffc-a94e-1ffeddc486d8","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2406.09617","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:69f8d7f07f547cb7af25697d9d7abd168309a3c63d9c8c31a0dbeff65d0aa234","observation_id":"e56bc495-1146-412f-a0d5-7d6b5ef30de5","resolution":{"observed_at":"2026-07-09T15:16:18.192224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.371998Z","title":"Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection,","venue":null,"work_id":"a5199271-2ffb-400d-912b-e09175d9b663","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:dcf8e313f9ee7b4198f81dd6748c549da279eeac1e1cabdd5908ea49a9b76ca0","observation_id":"4692176c-5662-45d6-b5ac-c5fa00ca9c1c","resolution":{"observed_at":"2026-07-09T15:16:18.373311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.338460Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":"045e8a03-8d04-4678-9314-6b8bff6f0f07","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:5a8fbfb7bc73c2fd76bc5a9aa3fc64e430befffc1b8aa8bd4d13b3c00a3e7ab1","observation_id":"a6bd654a-fe3d-425b-9f65-b98a84a59c74","resolution":{"observed_at":"2026-07-09T15:16:18.339998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06592","last_updated":"2021-07-25T15:00:51Z","snapshot_observed_at":"2026-08-05T01:33:12.418999Z","submitted_at":"2021-07-14T10:30:34Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection","version":2},"cited_work":{"arxiv_id":"2107.06592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06592","snapshot_observed_at":"2026-07-09T15:16:18.182832Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection","venue":"eess.AS","work_id":"70d87ecf-ea91-43f5-a9a8-0fb9dc3cbd49","year":2021},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2107.06592","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:78900285aac1fa704f6e07fd8943d0ab01d7b061c9386cd21276b72c2482b8a1","observation_id":"8823cca0-f77c-4553-b411-afb1410635fd","resolution":{"observed_at":"2026-07-09T15:16:18.184153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":"2406.10082","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-07-09T15:16:18.164748Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":"eess.AS","work_id":"ec617c61-bff7-4e12-9684-b5312ec20fd0","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:6c641f865f65f64a9ddb11f86359247a0a486118064da79ca530d00a93715719","observation_id":"f39153ad-0790-4acc-a295-d007ff5aaa2a","resolution":{"observed_at":"2026-07-09T15:16:18.166295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.193587Z","title":"Triadic Multi- party V oice Activity Projection for Turn-taking in Spoken Dia- logue Systems,","venue":null,"work_id":"cd1ef342-754f-4e89-b12f-24c23bfece5b","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:e5af3b7dbac76c7dd6b55e1d009e0a588a5f47e80b8f2ae311dddb5f14de61d3","observation_id":"9eef50a1-4531-47c6-904d-92b43f8c6444","resolution":{"observed_at":"2026-07-09T15:16:18.195382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.362507Z","title":"Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of V oice Activity Projection,","venue":null,"work_id":"68918f5e-7138-4771-a4e1-a0d35b5092ea","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:97b4719fe19392f280bb78489826d61f87cfc65113bb3c42abf392761287d3bc","observation_id":"6364f2d9-d724-4985-9d88-3fbf7c07ef6e","resolution":{"observed_at":"2026-07-09T15:16:18.363896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.364623Z","title":"Predicting End-of- turn and Backchannel Based on Multimodal V oice Activity Prediction Model,","venue":null,"work_id":"366e511b-1534-4e31-8f07-c2e77809142d","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:90c00ec8e66a7d74c133ad8f079a88f7c80b4f50bbf77910b213e4d12234b11c","observation_id":"798ee106-eef7-402b-ad6e-c44d0ada81c3","resolution":{"observed_at":"2026-07-09T15:16:18.365940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.365039Z","title":"Multi- lingual Turn-taking Prediction Using V oice Activity Projection,","venue":null,"work_id":"dabbea92-e02c-44b6-825f-7185b6140f58","year":null},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:adc73c85729d7321cb3907b6832e96c33db0b93ea0223f067428247ec0c582cd","observation_id":"efab9e88-132a-48c6-bc93-38cca0e4d9a0","resolution":{"observed_at":"2026-07-09T15:16:18.366437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06487","last_updated":"2024-03-14T23:59:59Z","snapshot_observed_at":"2026-07-06T17:42:29.208344Z","submitted_at":"2024-03-11T07:50:29Z","title":"Multilingual Turn-taking Prediction Using Voice Activity Projection","version":3},"cited_work":{"arxiv_id":"2403.06487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06487","snapshot_observed_at":"2026-07-09T15:16:18.173615Z","title":"Multilingual Turn-taking Prediction Using Voice Activity Projection","venue":"cs.CL","work_id":"51646c36-1219-4455-85aa-41fdc296634a","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2403.06487","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:31f5cd147ff99bd2ce976616c4e4d956fd7251e2da351834067d95c379936b67","observation_id":"deaf6d46-f308-4e15-b733-d528c8ebf0c3","resolution":{"observed_at":"2026-07-09T15:16:18.174784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.351989Z","title":"Investigating the Language Independence of V oice Activity Projection Models through Stan- dardization of Speech Segmentation Labels,","venue":null,"work_id":"7022245b-318b-4f1a-ba33-fe0b53e85089","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:e850bacc6685bbe1bcf80114d237e99bc54a3f0ee5ca177b6ea4baf8323232e7","observation_id":"43e6bba6-d75f-40ce-b5e1-dae18d5ae313","resolution":{"observed_at":"2026-07-09T15:16:18.353223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04868","last_updated":"2024-01-10T01:09:55Z","snapshot_observed_at":"2026-07-06T17:13:29.467366Z","submitted_at":"2024-01-10T01:09:55Z","title":"Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection","version":1},"cited_work":{"arxiv_id":"2401.04868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04868","snapshot_observed_at":"2026-07-09T15:16:18.171040Z","title":"Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection","venue":"cs.CL","work_id":"9faf4f1c-b103-4078-9f66-f70c2031cdfe","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2401.04868","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:370f2da5eca40538b157cf329b9d62151e5d32a93c944e15847ecd9647de9576","observation_id":"e2e4601e-d5ba-4c72-b71c-0438836b5697","resolution":{"observed_at":"2026-07-09T15:16:18.172565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.348282Z","title":"Applying General Turn-Taking Models to Conversational Human-Robot Interaction,","venue":null,"work_id":"f91d489c-5b2f-45b4-a265-f3130ceb3d76","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:97b2169a929ddf3bd92af43e8ccc23c8bb3509c8180662e51524c791dd913d7a","observation_id":"15f01bfe-0936-4d00-88a9-dc5b1ca7f709","resolution":{"observed_at":"2026-07-09T15:16:18.349501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.381911Z","title":"A Noise-Robust Turn-Taking System for Real-World Dialogue Robots: A Field Experiment,","venue":null,"work_id":"5e3c9e16-d7b9-4a1f-9821-0f1757f12310","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:b1ab013fd77525dec681a1334625f7c55bc7994878a473be6972bdd08c0e5880","observation_id":"1a211102-c65a-442b-9e0e-168a5460d3fc","resolution":{"observed_at":"2026-07-09T15:16:18.383096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.390827Z","title":"Multimodal V oice Activity Prediction: Turn-taking Events Detection in Expert-Novice Conver- sation,","venue":null,"work_id":"efa802b3-6383-4a60-bb12-b8e7e5436ab5","year":2023},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:d37e1853094251874f2d2efa4468411028ed345461f89fa1c98639c1fd9c318e","observation_id":"7534f11c-3d9f-4270-8692-5ce08e54edea","resolution":{"observed_at":"2026-07-09T15:16:18.392045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.360839Z","title":"The NoXi database: multimodal recordings of mediated novice-expert interactions,","venue":null,"work_id":"7e8e06ab-5954-48bd-a1da-743cc3d58f4d","year":2017},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:f138fea866faf8f007e9acfe1cca5be79cf06a50d7f10b45b813b23c511dfe22","observation_id":"fbb30dbd-9767-496d-9c1c-d43bcc6e0859","resolution":{"observed_at":"2026-07-09T15:16:18.361970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13726","last_updated":"2024-09-09T18:37:34Z","snapshot_observed_at":"2026-08-01T17:58:02.181107Z","submitted_at":"2024-09-09T18:37:34Z","title":"Multilingual Dyadic Interaction Corpus NoXi+J: Toward Understanding Asian-European Non-verbal Cultural Characteristics and their Influences on Engagement","version":1},"cited_work":{"arxiv_id":"2409.13726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13726","snapshot_observed_at":"2026-07-09T15:16:18.185410Z","title":"Multilingual Dyadic Interaction Corpus NoXi+J: Toward Understanding Asian-European Non-verbal Cultural Characteristics and their Influences on Engagement","venue":"cs.CL","work_id":"ecb26f67-6b55-4a2d-9db8-636f06c55a07","year":2024},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2409.13726","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:ba5b9db0da4482947a7f790c31e63344f588818c4d0bde3e76de2614e2c5883e","observation_id":"20d8a772-8675-41ad-9df8-c90507514cfb","resolution":{"observed_at":"2026-07-09T15:16:18.186867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-11T23:19:05.119745Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":30},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.07294."}