{"as_of":"2026-08-07T18:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cb16d15e50c9955a33ccd0352dc9767257f9320b7ed25ac26415d3551448b7b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:07:21.595291Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:07:21.595291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T18:28:48.556997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"cited_work":{"arxiv_id":"2606.16731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16731","snapshot_observed_at":"2026-07-03T18:28:48.556997Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","venue":"cs.SD","work_id":"cf91751e-ebb2-485b-9040-095ba18b48c3","year":2026},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2606.16731","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:202a3d80b7667e9c4a536698202b71adfadff7e078115712d1083f6f7624cb2a","observation_id":"f36efb2e-6f6f-4bd5-92ce-69391bc00b89","resolution":{"observed_at":"2026-07-03T18:28:48.558828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.16731/citation-record","integrity":"/paper/2606.16731/integrity","json":"/paper/2606.16731/citation-record.json","paper":"/paper/2606.16731"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"cited_work":{"arxiv_id":"2606.16731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16731","snapshot_observed_at":"2026-07-03T18:28:48.556997Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","venue":"cs.SD","work_id":"cf91751e-ebb2-485b-9040-095ba18b48c3","year":2026},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2606.16731","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:202a3d80b7667e9c4a536698202b71adfadff7e078115712d1083f6f7624cb2a","observation_id":"f36efb2e-6f6f-4bd5-92ce-69391bc00b89","resolution":{"observed_at":"2026-07-03T18:28:48.558828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Active Speaker Detection vs","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:98197e2b5b85f1b43186751e7877de693657f55009ff60c6a991fe6bbc874894","observation_id":"c76e66d1-cb7e-4d53-99ca-9f1b701a0873","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Speakers use these visual sig- nals alongside prosodic contours to navigate turn-taking [25]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d9954f9a3e8989b38ce042af89e5981b8cc5a1e9118157aff7c26225c5a834d9","observation_id":"3139902c-37a5-47ac-b9f9-00f30bcda4ff","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"As illustrated in Figure 2, these sources contain editing artifacts like jump cuts that disrupt the temporal flow of conversation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:5f3911b146ed1656854b5e655e2be48a577d9b25218b42a05cd60fae6d68ef78","observation_id":"e0ee3743-5aaa-456e-8a35-ab48ed0eadc4","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"cur- rent floor holder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:dede753a9469d3a72e7dbbe28b5eb808f261a854064e1d6649aaca060d43e69b","observation_id":"bb8d106b-18b1-4eac-9513-9608b5378572","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The speaker with the highest activity is designated as the current/past floor holder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:7c015e64fe92e3d1f7851f78a7b3a93b52c4ddb4a719833742eae707f9848498","observation_id":"f66b50f1-5110-4f3b-bcbf-6c197d1de354","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"social conductor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:1e53e54c027e32fbbcc89ef2ea80d7daafefb29cc2fa2f399f420f6f8c291760","observation_id":"7f8598bf-38c4-4d92-a7ff-974d3538f7ed","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Each dataset is mapped to specific mod- ules to facilitate multi-stage training as shown in Table 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:82a74301db4cdd3c0b65f7ba0aac2866f6e1c668515c85cb9d62d3caae9d05a2","observation_id":"8e47ae96-bca5-491c-a25a-0a9335b08040","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"To measure the usefulness of these learned embeddings, we de- fine a set of downstream tasks for evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:b3146bac76d4a1cfdcf00789b5d337be00fd84c4ca3caafb530bd99275da4800","observation_id":"92989b43-558d-415a-bf03-49d5950ed0b0","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Results are reported as mean ± 95% confidence intervals over ten runs using random seeds 42–51","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:32614ba9237f144cf7c94770cb325087ea8cab77bbb21ea537f0c42e57acd557","observation_id":"d9d06664-d428-496f-b7d6-66f34eea6575","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:2034b2db758d376882b6fc184bc80f974ecf0a784a752331407d3c2bba87c083","observation_id":"8c73ec7f-3f6e-4d12-bdad-38dc3f72a73a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"To address the scaling bottlenecks of joint modeling, we proposed a Role- Relative Projection that compresses complex group dynamics into a scalable pairwise state","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:60b26670223219ec22af49d050fe6a1e8acc21dbfbe01378973e5d5182934e7f","observation_id":"75617a5c-7956-4b5f-8242-c9c0d56c36f6","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The computations and data handling were enabled by the Berzelius resource provided by the Knut and Alice Wallenberg Foundation at the National Supercomputer Centre","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:1986fbb99e2e597cde1833322dc974e2895a11243ee7e5294b5b10c305c7e263","observation_id":"5b5744e8-eee0-434b-b2b1-0681fa988452","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"These tools were not used for writing any major parts of the paper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:0f26d53848805a1eb907fe0b73f6c741924ddd6da5f6a8dd15f6724859927500","observation_id":"285fca42-d911-45d1-bb47-51bf5668dc3e","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Some signals and rules for taking speaking turns in conversations,","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:cf0ecd658f23a5e1709a663685cce2dc83ddc54829aa5984a305b914e0af87b9","observation_id":"4ce2c715-9606-4595-8329-3eb480042423","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A simplest system- atics for the organization of turn-taking for conversation,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f076b755edaec29e28cfab17ac46b11ae1aa1cc0171ab493c2ac57bf754031c7","observation_id":"b4e5f3ff-1ae7-42eb-a55b-7b1ec722468f","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"On the structure of speaker–auditor interaction dur- ing speaking turns,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:83fe9c7233c0f4119e3f537a285f92713fca6951173c4ca94c746301b2c8e834","observation_id":"6cf5e31e-fdc8-4731-99f1-c01cc91240ff","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Interactional units in conver- sation: Syntactic, intonational, and pragmatic resources for the management of turns,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:47a4e93ea46f94a4cd8a82af82f4562e46549cca35d3e24a648d9a8bbad157f8","observation_id":"e631b712-18cf-470f-9b4e-dbcedcb34f2d","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:028629f43c3001e73cfef2ecd4160383a883d9bf397d5f19960b54c72ca312c6","observation_id":"139550a6-2339-4df4-a36a-5305bd8f8db9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Listeners’ responses to filled pauses in relation to floor apportionment,","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:fe5638a0abca146ab4f757de56c1ceb6ed1b44805fc6f5b7dfdea40dce50fa58","observation_id":"b72276a9-e146-4ff6-939b-fcb63dba6252","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Duncan and D","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:286d547ff41d3abface0200bac6e1f26d8c1bb443b53bb6dc4962bd4cbdc972b","observation_id":"b6789a82-4ca9-43d6-80f0-87d792e0a33f","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Universals and cultural variation in turn-taking in conversation,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d7f6456a4152f9b8273ce0dc354bdc41ae30e50fb914b4d4e1fc1031a312643e","observation_id":"263b65d1-e839-4157-be7b-a8b5c34d0267","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Timing in turn-taking and its im- plications for processing models of language,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:c2ca1b26ff323e915fa80d48527c142a91b79ad328515793a137950801907c35","observation_id":"d9564aa5-84a4-47fd-8cd2-501c8ab63b54","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Conversational interaction with social robots,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:5ce883947297d5c00d6c5633d05239230d1be1e74aba81cb773e1e53db2563fc","observation_id":"576ab0ff-5dec-4e55-a7d3-7bd74f544ffc","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"V oice Activity Projection: Self- supervised Learning of Turn-taking Events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:c7209801033bbf34cc5a4020c079d4875a6c350ea10ae5a633b426d74a0df806","observation_id":"b36c8ee4-702c-4379-b974-53d4b1373a07","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:59ed370694925f01d2071c5905dbeeddd8a2aef32be36bf07cd66498a01eda74","observation_id":"8b5184db-4470-4ba6-a13f-ac56326670ba","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Applying general turn-taking models to conversational human-robot interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:5287757016c31769af566474b6b7a597b9e4c4952b64a100cd4dd0a82502745c","observation_id":"29182a9b-607a-47a4-af56-173a9ef98ff2","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal turn analysis and prediction for multi-party conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:c9c3a77e2502ae12a48c4ecb6d8227420df50971cf57d709f5a120f2dac80ac5","observation_id":"e4670881-626e-4cac-b08f-8c61af0a82d9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Triadic multi- party voice activity projection for turn-taking in spoken dialogue systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:41c8fcef3f3c06decab3afebe0a741ecde75b057bdab510379da14bc4ab98d4c","observation_id":"230c954f-88e0-4382-b50b-abf875c123de","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"MSDWild: Multi- modal Speaker Diarization Dataset in the Wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d60446a229890351ea2a555c993d7ab105294327b58334f491080fbaa6683dc8","observation_id":"04ce0820-801e-43c7-a49e-b5d85dd01813","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Is someone speaking? exploring long-term temporal features for audio-visual active speaker detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:0c13e39ae4e18889fbe3903822dc76f3ebcc8e8d6bf8f0589006494901eb6bcc","observation_id":"39a7fd18-d883-4e6d-aa79-84f9d8f692d9","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Loconet: Long-short con- text network for active speaker detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:5def5e9fa725356c13ed791a600dc55335fc1c7c84171e85eb5b2e61ceccf88e","observation_id":"3bd0a8b7-d65f-4ad0-b3a7-a2b29f5c5263","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A V A Active Speaker: An audio-visual dataset for active speaker detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:c389a89f3c98ab8254e26d271bec9a317f273704d2e7f94216ca2040bf5f4c46","observation_id":"2f1d3e61-b0db-42df-9d2e-3163d443c0bd","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"How much does prosody help turn- taking? Investigations using voice activity projection models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:e3831ae9c0c830912528c905baa6195975e62157bf9cade5d8d7b43145e6fa2b","observation_id":"67e01810-8c63-42cd-b057-5e4c1ccbacfb","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Pre- dicting next speaker and timing from gaze transition patterns in multi-party meetings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:27acac0977404d3c1f89624c1f4efe85099f5ff28de7efb3887c01c2efc0bfb9","observation_id":"f75a2a91-6178-4897-8442-a3a11e608d87","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Gaze-enhanced multimodal turn-taking prediction in triadic conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:ffb1a16841fed43a99be1c8336a8c0a44744232012b79d2935c73749178544ae","observation_id":"ffe121ca-e8a1-4829-b880-36247af409ad","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal voice activ- ity prediction: Turn-taking events detection in expert-novice con- versation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:b4a9d3453a923df5e9edba861ca109729beb9d0698cf20e3627162679d3f0bd9","observation_id":"55edde12-ffb7-4a86-9a28-e4bfcdf57877","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Prediction of who will be next speaker and when using mouth- opening pattern in multi-party conversation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:3c37338b4219eedebffc2515bc5ea62189a581d0c44ab979366f88ee77a6bd0a","observation_id":"94301a8b-ce4e-4929-8f27-5745af8442f3","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Who’s next? speaker-selection mech- anisms in multiparty dialogue,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:e80c234ba30657c143d3d70c958acbd6b4a4c91622a699ffd7fee3d3f4777d91","observation_id":"282b4ec7-d778-4334-860e-f9e00fde0f7d","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"A computational study on sentence-based next speaker prediction in multiparty conversa- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:12bfa3356c7fcff6ed8f49f6837a28059d65072b70ffa891b946497a0f318056","observation_id":"c34b7288-4b49-47bb-b426-1276ea6e626b","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multimodal continuous turn-taking prediction using multiscale rnns,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:73fc1828b9e815954ca3467aad8e93d29111ee4713d546f6827a4b6c2937c88d","observation_id":"6ca54da5-eb64-4402-9d55-d8603ab2a370","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Visual cues enhance predictive turn- taking for two-party human interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:d7376fad25b59e253c9fe134e2ce3f06d710b03b4c3a7ab6768255de87c750d3","observation_id":"698a3705-cf51-4d13-a52f-b043e9bb30cb","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Multi-channel sequence-to-sequence neural diarization: Experimental results for the misp 2025 challenge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:680eb74cd3236c16236bafcdce63af156f98be2b11af87c9bfffcaf9bb2841e0","observation_id":"9044764c-9e12-458b-94fc-9d75d12e0373","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Enhancing gaze prediction in multi- party conversations via speaker-aware multimodal adaptation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:553fa7e8e3db2ff4452636f1e76c850213daae9343c19f48c8e0ac14b65a139a","observation_id":"7f9de156-b3f6-43e6-8e59-d6b56101ce79","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03932","last_updated":"2021-09-07T06:22:37Z","snapshot_observed_at":"2026-07-06T11:16:52.956340Z","submitted_at":"2021-06-07T19:44:56Z","title":"How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild","version":2},"cited_work":{"arxiv_id":"2106.03932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03932","snapshot_observed_at":"2026-07-03T18:28:48.550070Z","title":"How to design a three- stage architecture for audio-visual active speaker detection in the wild,","venue":null,"work_id":"d0fc66dc-d31d-431a-989b-c5415a6e065e","year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2106.03932","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:2a9d5d345db8e628f9f1d86c02b8a0d1e7e59adbbbe8b15845a15d6124194117","observation_id":"046df085-fe82-40d3-b739-b1ce3266c32c","resolution":{"observed_at":"2026-07-03T18:28:48.552321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f0e59bedd292d09500fcf9191191d9aaf47e07f07e3afc561ec0127b222d283f","observation_id":"be42c76d-3a41-4a0d-9b13-226562d5a6aa","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The ami meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:e8f0c30b38b7a1d56b9c61dad004873d4253af4daf64027b77c51c73ea44ed11","observation_id":"af1d6367-b199-4b46-b983-96fc7fe6c27a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Masked face recognition challenge: The insightface track report,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:6b7e5cc71379d46d2bb13c3afd369feea082410ceca55c1bd1239413bad39adc","observation_id":"cf837a0f-01a3-47b8-b337-8909737f0e03","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Reti- naface: Single-shot multi-level face localisation in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f56326b35148418f888e1fa5e1b84864706bdfc2ef05f541f8124ebbeb4481c3","observation_id":"c3e201db-ef58-40bb-ae0e-6a5e1906ff56","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04714","last_updated":"2021-05-10T23:51:14Z","snapshot_observed_at":"2026-07-06T11:08:10.746485Z","submitted_at":"2021-05-10T23:51:14Z","title":"Sample and Computation Redistribution for Efficient Face Detection","version":1},"cited_work":{"arxiv_id":"2105.04714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.04714","snapshot_observed_at":"2026-07-04T03:19:31.625145Z","title":"Sample and computation redistribution for effi- cient face detection","venue":null,"work_id":"77e21ba3-b09c-4e54-9517-c3e970070311","year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"cited_paper":"/paper/2105.04714","citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:648f791046bd9873870faa6357d3d9d658f2cfb201d3614cf42b55e3d37c00fe","observation_id":"3b7016e1-5ece-4d8b-aeb5-32a5810a852e","resolution":{"observed_at":"2026-07-03T18:28:48.555627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Arcface: Additive an- gular margin loss for deep face recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:953c7b87d4264a2b322cf481772234fda47be91bace305adb20eed6c022eda6f","observation_id":"0331cf43-59e2-4f3a-b9e3-6771ba64fba6","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"The hungarian method for the assignment prob- lem,","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:0d472044461b6a61e8a67e6321737007b6dbc3ef8a0c1d43e9f0014538dc6e25","observation_id":"b9ac109e-7808-4016-904e-44926d34dd8b","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:f760c9b90b0805cc14dcd2d38ed072469c07d852902a3e26f2b57022f96b922e","observation_id":"ed4ba27d-1daa-4f5b-a733-9875f0e4511a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Talknce: Improving active speaker detection with talk- aware contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4c222a037b0173bb8428f703d659e7363a5cb954f5b5577dd2d8d0f5bf7d499e","observation_id":"323e1dd9-cfbe-4132-8a7f-04bad1d0fc3a","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T03:07:21.595291Z","title":"Turn-taking in conversational systems and human- robot interaction: A review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T03:07:21.595291Z"},"links":{"citing_paper":"/paper/2606.16731"},"observation_digest":"sha256:4e9de72aaf20c1edd3dfdfe051a90e2828f8dad8356af1adb5ffd9798211cbae","observation_id":"ad3284fd-6c37-445a-8d4f-5888be7ac71c","resolution":{"observed_at":"2026-06-27T03:07:21.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.16731","last_updated":"2026-06-18T23:18:59Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T18:41:47.579468Z","submitted_at":"2026-06-15T13:54:44Z","title":"MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":52,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2606.16731."}