{"as_of":"2026-08-06T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:909f40cf321b8a3265e2ccac0b21b6031b68a131638794f1b699b199d3b47e6b","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T19:45:11.576808Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T19:39:05.211169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T13:38:19.013877Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"cited_work":{"arxiv_id":"2511.18209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18209","snapshot_observed_at":"2026-07-03T13:38:19.013877Z","title":"Motionduet: Dual-conditioned 3d human motion generation with video-regularized text learning","venue":"cs.GR","work_id":"a68260c3-15d3-4fc3-b38b-9e1ce6cc7e0d","year":2025},"citing_paper":{"arxiv_id":"2605.14716","last_updated":"2026-05-15T02:07:43Z","snapshot_observed_at":"2026-08-01T19:56:37.692552Z","submitted_at":"2026-05-14T11:36:18Z","title":"AnchorRoute: Human Motion Synthesis with Interval-Routed Sparse Contro","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T16:14:13.795423Z"},"links":{"cited_paper":"/paper/2511.18209","citing_paper":"/paper/2605.14716"},"observation_digest":"sha256:106b099931ab95cd26dcd50aabb9b75f50f9da6ae1164577f7962acd8313bd61","observation_id":"734c08a4-3362-4298-b2c7-c783446adb18","resolution":{"observed_at":"2026-05-20T00:05:37.711805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"cited_work":{"arxiv_id":"2511.18209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18209","snapshot_observed_at":"2026-07-03T13:38:19.013877Z","title":"Motionduet: Dual-conditioned 3d human motion generation with video-regularized text learning","venue":"cs.GR","work_id":"a68260c3-15d3-4fc3-b38b-9e1ce6cc7e0d","year":2025},"citing_paper":{"arxiv_id":"2605.14731","last_updated":"2026-05-14T11:56:03Z","snapshot_observed_at":"2026-08-03T07:16:30.490848Z","submitted_at":"2026-05-14T11:56:03Z","title":"UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-30T19:39:05.211169Z"},"links":{"cited_paper":"/paper/2511.18209","citing_paper":"/paper/2605.14731"},"observation_digest":"sha256:cd2847d7a5a0f247da8c89bfb7c71877597adb56905fe316e9e66531e3884121","observation_id":"e18a68c4-5eb1-4fca-b887-0435bd83f35c","resolution":{"observed_at":"2026-06-30T19:45:00.897818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"cited_work":{"arxiv_id":"2511.18209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18209","snapshot_observed_at":"2026-07-03T13:38:19.013877Z","title":"Motionduet: Dual-conditioned 3d human motion generation with video-regularized text learning","venue":"cs.GR","work_id":"a68260c3-15d3-4fc3-b38b-9e1ce6cc7e0d","year":2025},"citing_paper":{"arxiv_id":"2606.11656","last_updated":"2026-06-25T06:35:40Z","snapshot_observed_at":"2026-08-04T04:04:48.584093Z","submitted_at":"2026-06-10T04:38:35Z","title":"MoGeFlow: Flowing Through Motion Codebook Geometry for Text-to-Motion Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T07:48:24.383009Z"},"links":{"cited_paper":"/paper/2511.18209","citing_paper":"/paper/2606.11656"},"observation_digest":"sha256:cc44a3511a989a29cb9f53c366adb6cf6c7a06a2355e02de1e3d475bb8af3a2d","observation_id":"27528227-68ec-42de-a421-9c21366ae4d2","resolution":{"observed_at":"2026-07-03T13:38:19.015130Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.18209/citation-record","integrity":"/paper/2511.18209/integrity","json":"/paper/2511.18209/citation-record.json","paper":"/paper/2511.18209"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":"001944aa-288f-4955-9a02-c983e61e9ce1","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:33d40c39a49cda4994e3b32cf49206f33f5427eb7e92780a48b8565b1bbe6889","observation_id":"127df5a5-95e4-4cb7-a511-634946184d36","resolution":{"observed_at":"2026-05-21T19:45:33.305262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revideo: Remake a video with motion and content control","venue":null,"work_id":"f42b608a-1150-4795-ae42-b32de8f212ba","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:3b61c6f809d5e57c909ad4307dc75e8723abe8535e37f4ef38a5b76d6a344daa","observation_id":"bd746331-99bb-41ec-8b1d-50bd3518caf2","resolution":{"observed_at":"2026-05-21T19:45:33.312966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous, subject-specific attribute control in t2i models by identifying semantic directions","venue":null,"work_id":"809eae4b-7947-4b22-9f78-19c3d37eb52c","year":2025},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:cc5279e666b461f08cbb80bb362597fdf4263ccf562aa4247749a503148da37b","observation_id":"fa7c81a6-ece7-4192-bad2-17e362a097ac","resolution":{"observed_at":"2026-05-21T19:45:33.307708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fg-t2m++: Llms-augmented fine-grained text driven human motion generation","venue":null,"work_id":"c2f60451-ef70-462c-aac6-1703f31bb7ea","year":2025},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:5ebb68980dfd74f4fc9b22bc209b07519f814e5fdc2e8baffd134b47ef4ade79","observation_id":"847ef798-0c6d-45e4-bf0a-13f1e318b94b","resolution":{"observed_at":"2026-05-21T19:45:33.302594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vmc: Video motion customization using temporal attention adaption for text-to-video diffusion models","venue":null,"work_id":"4f4d19b5-f20d-41ca-a919-5fc33684b806","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:972f1ed223e84cc39f230feca04f1ae75e01d4a6661880b8220f5c4a39e07528","observation_id":"2a03cc19-5955-485c-a1bf-afadb0028650","resolution":{"observed_at":"2026-05-21T19:45:33.230843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intergen: Diffusion- based multi-human motion generation under complex interactions","venue":null,"work_id":"47be93a0-506a-4c97-b186-61bd75fa3af0","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:5f7dc023adc0a18937ac058849d8095bedb757233ba5ef0a4f4a9b69fb141f84","observation_id":"bd68c92a-b5c1-4bef-94db-ceb38dbf39ed","resolution":{"observed_at":"2026-05-21T19:45:33.258410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:069c6442e0ffb01bd07a6c7983d88918aa6c9831456f2332d43be84032f34d10","observation_id":"acfd8d6a-966e-48d7-a268-710eef2c6a73","resolution":{"observed_at":"2026-05-21T19:45:33.190595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:2c2b25e536a80a2a3a240c61e16ea298ade7428214e829449edb0fc991f7b619","observation_id":"81864ecb-e436-4803-b771-7dd4f2ae94e4","resolution":{"observed_at":"2026-05-21T19:45:33.203525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parco: Part-coordinating text-to-motion synthesis","venue":null,"work_id":"74eb22e6-a4ac-421d-86ed-d332d57a2cc1","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:032de0c727b35e730cac0e831419fefa67a43cc11bc497f389b70e3d8d632a67","observation_id":"c197634f-2ff6-47ff-a06e-f10db333adc6","resolution":{"observed_at":"2026-05-21T19:45:33.237147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring text-to-motion generation with human preference","venue":null,"work_id":"4107c58c-7796-4292-88e7-b640be8400c5","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:a9552392e7b122f4ab6b17a45865842f159f1b4c1a915257b8add8b02c842f83","observation_id":"b140d07d-8aca-424f-86eb-af84b6064d30","resolution":{"observed_at":"2026-05-21T19:45:33.269666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15134","last_updated":"2022-10-28T02:32:05Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T02:45:48Z","title":"Learning Variational Motion Prior for Video-based Motion Capture","version":2},"cited_work":{"arxiv_id":"2210.15134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.15134","snapshot_observed_at":"2026-07-03T10:37:56.728573Z","title":"Learning variational motion prior for video-based motion capture","venue":null,"work_id":"f9094049-daaa-4e29-ba87-6048eaa8f1cf","year":2022},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"cited_paper":"/paper/2210.15134","citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:e04e6eea57007a6b2a31cf83c9c0703826f93c109d45ecab18679c71dc8895a6","observation_id":"2e2b77bd-80a8-4587-b708-86e2c332f0e1","resolution":{"observed_at":"2026-05-21T19:45:33.209225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dancecamera3d: 3d camera movement synthesis with music and dance","venue":null,"work_id":"23665f13-6657-4405-ace7-f33fe1f81c7a","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:1ef966c370e9c452c1a95785f0b80e3298ac06c6beb532c34750c276babbe7d1","observation_id":"57c3f223-258a-491d-bf96-e07cbbaefa28","resolution":{"observed_at":"2026-05-21T19:45:33.233889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bidirectional autoregessive diffusion model for dance generation","venue":null,"work_id":"93e38342-f42b-4f7d-bdc2-138187d86c4c","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:babf5070a030757b01e3b4eeb9d6cc163108519060f509dec1f75de3ad9e6c8d","observation_id":"83dfe628-0237-4fd2-9b69-19a45350be06","resolution":{"observed_at":"2026-05-21T19:45:33.275061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modi: Unconditional motion synthesis from diverse data","venue":null,"work_id":"45000806-c971-40a8-86ef-41e7e12fdee6","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:0e9f320e72b112c708169f7a8b2a7ca09333881176dbfddd1d243f018bcbdcc7","observation_id":"a9b0aacd-2c76-42e2-989b-828a43808f2a","resolution":{"observed_at":"2026-05-21T19:45:33.290058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fg-t2m: Fine-grained text-driven human motion generation via diffusion model","venue":null,"work_id":"5d9d2d3a-2ca3-4e4d-a5c2-3f76808416e0","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:d4371fa3d835df7a28ee3ef14aa73dbf9eb4d8fc904ab5c532062052167e3cf0","observation_id":"97a60cd3-5873-456d-b97a-a33164c062c2","resolution":{"observed_at":"2026-05-21T19:45:33.297643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesis of compositional animations from textual descriptions","venue":null,"work_id":"e32d1a26-4757-4e7b-9848-cc1b5be35524","year":2021},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:404fa5ed669f2013ef0d51c47c554d7c859d07e22616fc7a25a57d5f589f105a","observation_id":"6c424c4e-deb0-48bc-9024-c06ea45603f8","resolution":{"observed_at":"2026-05-21T19:45:33.255921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":"91c32984-5be0-42e6-b10d-e93a936b2516","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:15e58c9a5334c4ada8e8d0d209f00149be1cf75bf9c04f7a09bda82451c36eb1","observation_id":"96560a3b-594a-4b3a-8744-a9f34d9ba21e","resolution":{"observed_at":"2026-05-21T19:45:33.220724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":"4afff8c9-3fc0-40bf-b1e2-2c324cf294ef","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:b59c9b0f67a6d434bf49fd92c46a15314a64c21f954f5c56b05323c5306c3658","observation_id":"0b4e5988-df41-4c86-97c0-350b1ba56409","resolution":{"observed_at":"2026-05-21T19:45:33.272684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation","venue":null,"work_id":"d2cc096c-d70a-44f9-accc-4ea6d8886e55","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:b23b30299e7e2bc11198ee8bb767b3d765fb5a790a049c36621e3e14f21fffbb","observation_id":"ed74cbea-2f2a-484b-a4cb-42d5224a902e","resolution":{"observed_at":"2026-05-21T19:45:33.295163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"51e8f46a-58dd-4ae3-98ba-f215e0d017a2","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:410117e393ad4797004e8bdda43a3e5d2cf30f2f1c45b5e8faf402cce107dd64","observation_id":"3493ad64-093d-4f46-a9cc-be7177b83acd","resolution":{"observed_at":"2026-05-21T19:45:33.280970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangled clothed avatar generation from text descriptions","venue":null,"work_id":"be8746cd-1bb9-4487-8d3e-90b54c0f1e01","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:e30746453050ab79fa4502a6db3e52a1e94797ffa5162e7563fb1f850069d71c","observation_id":"8b77342f-04f1-4ffa-884f-62f3a97e063e","resolution":{"observed_at":"2026-05-21T19:45:33.252584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sesdf: Self-evolved signed distance field for implicit 3d clothed human reconstruction","venue":null,"work_id":"549969ba-4308-4003-b533-b847d562ffb0","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:521d99a69a6a64f0cefbc47ee24f26d2229f35f6a318423279c3c7b7c777d990","observation_id":"78d1e966-45ea-4374-8f93-7a094bbe041a","resolution":{"observed_at":"2026-05-21T19:45:33.263974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"9124677e-4367-4be0-a055-03113992b4d5","year":2022},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:705a71ce3491b8e428376ea695792a504900fad6adb11b39d94cf3d68eabcea0","observation_id":"5725e924-77bd-4be4-b7bd-9208159f83de","resolution":{"observed_at":"2026-05-21T19:45:33.292581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepphase: Periodic autoencoders for learning motion phase manifolds","venue":null,"work_id":"6384cf66-1ba5-4fa4-9d61-d7c345a32ff6","year":2022},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:c7e053f956891e0ba0ab49084fe358791b7a57a8b73c235f76c7290c7f7382aa","observation_id":"333031e6-ddc0-42ae-beb9-99c317ab1da2","resolution":{"observed_at":"2026-05-21T19:45:33.250000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":"cb7b4eaf-32ac-42d4-8dcb-b1bcace065e0","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:7dcab8b6f38204446cc30e7b4bb45e40923e7951bd9badb1c225ea1848b59707","observation_id":"7a52f8ae-9b87-4d74-b91b-934ad1e581b8","resolution":{"observed_at":"2026-05-21T19:45:33.261467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mcre: Multimodal conditional representation and editing for text-motion generation","venue":null,"work_id":"1d5fb0c6-a63a-4185-8f7f-7501fb76f27f","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:8addf49996f54b04a94a1999431063434253b6ecfced6d3f6aa76d4a3dfac236","observation_id":"052605d9-74d3-4699-8a39-5f170ce20efe","resolution":{"observed_at":"2026-05-21T19:45:33.243611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tl- control: Trajectory and language control for human motion synthesis","venue":null,"work_id":"2985f0a7-28db-4ab5-9f58-c03eda8997e8","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:bcbfddef4587eebd15dcc6edc8acad540f5a5c968fbad1f9a521bd401107a393","observation_id":"02e25b98-399c-4902-9b68-5d0719d99a6a","resolution":{"observed_at":"2026-05-21T19:45:33.246661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking the spa- tial inconsistency in classifier-free diffusion guidance","venue":null,"work_id":"327e669b-b35a-4148-b381-5f3f4b46b40c","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:73e5a41ac9fb2f86311de5be94a9feaf348cd3cda692677d219aaac25fa02a42","observation_id":"98bc8131-42cc-41ec-8f5a-e6fcda54e3ef","resolution":{"observed_at":"2026-05-21T19:45:33.217777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tcfg: Tangential damping classifier-free guidance","venue":null,"work_id":"6777b6a7-2029-4654-b8ac-bba28324e12d","year":2025},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:43f392364ab47c05e9604acb288b6614f2220a16eb35ac31e45c5b42c0823169","observation_id":"fa1378a6-5c1f-40e5-ba6f-23b77bec60b7","resolution":{"observed_at":"2026-05-21T19:45:33.284601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"c62013f4-da1b-46bf-9553-8d98bfc5af60","year":2023},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:87a2f901670e5902af17aec2b8e7febb4f9f50fb311191bb8c2343e04b27ae3b","observation_id":"3ed1c6ec-e0b5-4721-b10c-8cb545e59618","resolution":{"observed_at":"2026-05-21T19:45:33.310520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":"de7594db-b4d4-48b8-b5c2-a6e0b008c641","year":2024},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:fc2afca9dc660e36da68bac44f5113f305301cfcffcd5cec1bcb85079c452cd6","observation_id":"58c02c2b-e497-482f-86ee-dfe46a181f9b","resolution":{"observed_at":"2026-05-21T19:45:33.214217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"8d600992-5d1d-4fa9-845f-18c4de22bfba","year":2021},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:fe33b082ca22f79d79743238957f63c73b8160db4aed933b64e86a9698d68339","observation_id":"334ac9d2-b5c0-434c-9e47-8f918699360d","resolution":{"observed_at":"2026-05-21T19:45:33.277782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Facenet: A unified embed- ding for face recognition and clustering","venue":null,"work_id":"dad72449-16b9-45e7-96c5-55c75a94358e","year":2015},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:e8be468bd12d609e231c52362b9210db06a1d934056bf05133cc52c3f07dd820","observation_id":"39a03f6b-1f60-4922-b64b-a5f53d7d782a","resolution":{"observed_at":"2026-05-21T19:45:33.300239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational optimal transport: With applications to data science","venue":null,"work_id":"64749d16-7068-44e0-b612-125bcd7b0047","year":2019},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:05bb53057695fadae41e892603b9fcaaf1a25c2909bfcc5e21782881c08b0e87","observation_id":"211ec898-13a4-4c22-ae08-016d597f5d7c","resolution":{"observed_at":"2026-05-21T19:45:33.240251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"f30dc3c5-a196-43cf-850a-da977035f261","year":2021},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:9285dfccdded87de9398aa7823cf18dc319d20a40c943148bd6c15bb992a90a4","observation_id":"7ddddd2d-3492-4b37-9760-1b77dff33a5a","resolution":{"observed_at":"2026-05-21T19:45:33.287273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action2motion: Conditioned generation of 3d human motions","venue":null,"work_id":"58becc33-0863-4593-ae50-c305d11b3fb8","year":2020},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:a46ebf6683a3ff2799f68065904439b0c461fe9abae9586b7130ef04b4df0b95","observation_id":"70eb6b22-71c8-4427-83f4-4510a6ecbb19","resolution":{"observed_at":"2026-05-21T19:45:33.224089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":"e075eee8-2af3-4d57-a844-5225ae7b6450","year":2019},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:fa9fe05259734186275e416a3e5dfef3310dc0c661f2d76024b4437cddd24807","observation_id":"9e1aa53a-f362-47f2-b009-8374792142fd","resolution":{"observed_at":"2026-05-21T19:45:33.227118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion capture from internet videos","venue":null,"work_id":"b5a8fa23-aedd-40e5-998b-217977bc16ce","year":2020},"citing_paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T19:45:11.576808Z"},"links":{"citing_paper":"/paper/2511.18209"},"observation_digest":"sha256:44ae54048ac1a56d32937c1d27bad700979f5faf0dc00a09b0895fc5b69c397f","observation_id":"741bd8c7-cd46-4ba1-9508-aafd36729c46","resolution":{"observed_at":"2026-05-21T19:45:33.266984Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.18209","last_updated":"2026-05-19T08:37:01Z","latest_version":3,"primary_category":"cs.GR","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T22:57:40Z","title":"MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 3 inbound Pith citation observations for arXiv:2511.18209."}