{"as_of":"2026-08-07T19:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09282d890b2524e9d21af6d6327adb4624f12cd478345380bfc708d29ba44842","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:24:11.789786Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T02:38:14.542361Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T02:40:14.611495Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"cited_work":{"arxiv_id":"2512.13840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13840","snapshot_observed_at":"2026-07-14T03:21:25.543486Z","title":"arXiv preprint arXiv:2512.13840 , year=","venue":null,"work_id":"6332ee20-5314-488f-8308-17fa56974544","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2512.13840","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:6622ac98d868c035350b090479f1c37e5310dacf7156778c91a866093a48f084","observation_id":"6d8e67f4-e507-4e5d-b646-23a855c64a9e","resolution":{"observed_at":"2026-07-14T03:21:25.543486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"cited_work":{"arxiv_id":"2512.13840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13840","snapshot_observed_at":"2026-07-14T03:21:25.543486Z","title":"arXiv preprint arXiv:2512.13840 , year=","venue":null,"work_id":"6332ee20-5314-488f-8308-17fa56974544","year":2025},"citing_paper":{"arxiv_id":"2604.02973","last_updated":"2026-04-03T11:24:34Z","snapshot_observed_at":"2026-08-03T01:47:30.481324Z","submitted_at":"2026-04-03T11:24:34Z","title":"Exploring Motion-Language Alignment for Text-driven Motion Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T20:52:17.036285Z"},"links":{"cited_paper":"/paper/2512.13840","citing_paper":"/paper/2604.02973"},"observation_digest":"sha256:b108afd6c74d41dc750008e5d792c9f4e81b942cb113736225951d88bf2a5f0b","observation_id":"32d94413-4f88-456e-923e-8fff1acbc227","resolution":{"observed_at":"2026-07-14T03:21:25.543486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"cited_work":{"arxiv_id":"2512.13840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13840","snapshot_observed_at":"2026-07-14T03:21:25.543486Z","title":"arXiv preprint arXiv:2512.13840 , year=","venue":null,"work_id":"6332ee20-5314-488f-8308-17fa56974544","year":2025},"citing_paper":{"arxiv_id":"2605.22894","last_updated":"2026-05-25T05:33:57Z","snapshot_observed_at":"2026-08-02T23:58:49.168142Z","submitted_at":"2026-05-21T14:17:21Z","title":"SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-25T02:38:14.542361Z"},"links":{"cited_paper":"/paper/2512.13840","citing_paper":"/paper/2605.22894"},"observation_digest":"sha256:2beb4d36f3ba97475b36e052f3704949db163e72e02dfed436e2116acc24d2ad","observation_id":"d62ee051-4ed9-4f31-be05-1e29b96d0eef","resolution":{"observed_at":"2026-07-14T03:21:25.543486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.13840/citation-record","integrity":"/paper/2512.13840/integrity","json":"/paper/2512.13840/citation-record.json","paper":"/paper/2512.13840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:03.735338Z","title":"TMR++: A cross-dataset study for text-based 3d human motion re- trieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:03.735338Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:99d3cf23b058a393401cdf9d5463afcf472afdb639d997d720fd898cd057c1df","observation_id":"489cce2e-addd-426c-a9ea-7ba2a434c490","resolution":{"observed_at":"2026-08-03T16:24:03.735338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:03.836592Z","title":"Keep it smpl: Automatic estimation of 3d human pose and shape from a single image","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:03.836592Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:95775de735af3c6514f5eee26e1f4440fb52f20c3f8ac8235acdecdfeed11929","observation_id":"d3efa9b9-fea3-4d37-ac04-8de1daab3d6c","resolution":{"observed_at":"2026-08-03T16:24:03.836592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:03.949819Z","title":"The language of motion: Unifying verbal and non- verbal language of 3d human motion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:03.949819Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:d5909dbd58bfda276113c33d9bcef2c83d0d4332cfed96ed206ccbc586351cfb","observation_id":"99d937e4-d9f1-4df4-aea7-fe56ba3e25e5","resolution":{"observed_at":"2026-08-03T16:24:03.949819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:04.104321Z","title":"Taming diffusion probabilistic models for character control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.104321Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:aec053a01d09415da11acd206dfce3f50b86191f2c808e155fcbe4bfc2710629","observation_id":"57945188-1b59-4058-9170-bb12fe383d7d","resolution":{"observed_at":"2026-08-03T16:24:04.104321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:04.254443Z","title":"Free-t2m: Frequency enhanced text-to-motion diffusion model with consistency loss.arXiv preprint arXiv:2501.18232, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.254443Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8cd12c0a26baa182e093e36c941768ec741cdc398eaa997d6fd96bb156c9e455","observation_id":"e5076399-c95a-48ee-9e30-ffbe118e78bf","resolution":{"observed_at":"2026-08-03T16:24:04.254443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:04.415455Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.415455Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8c22510d0e0ed297fd2852572354c666c2954c79c88d80eca2b9f6f3d3a4d092","observation_id":"a3eac881-5bef-46f9-a13d-ad71d4a635a3","resolution":{"observed_at":"2026-08-03T16:24:04.415455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19527","last_updated":"2025-08-07T08:03:29Z","snapshot_observed_at":"2026-08-06T14:03:56.701887Z","submitted_at":"2024-11-29T07:54:56Z","title":"DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19527","snapshot_observed_at":"2026-08-03T16:24:04.619572Z","title":"Dis- cord: Discrete tokens to continuous motion via rectified flow decoding.arXiv preprint arXiv:2411.19527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.619572Z"},"links":{"cited_paper":"/paper/2411.19527","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:88fdbae8450db13f0ff73a45b918b36488962d9bd05c2ff0afb6db83102d8ddb","observation_id":"0fd41aed-3507-4396-bc2c-e5ea6cadd327","resolution":{"observed_at":"2026-08-03T16:24:04.619572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:04.774401Z","title":"Mofusion: A framework for denoising-diffusion-based motion synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.774401Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:0661738f1c3c0af4ab08ed5ae4fbab7c8da608ee12acf9b7f98a93f8b5b9038f","observation_id":"6eddafe7-b3f4-4d7e-bf68-d15569393dde","resolution":{"observed_at":"2026-08-03T16:24:04.774401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:04.941472Z","title":"Motionlcm-v2: Improved compression rate for multi-latent-token diffusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:04.941472Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:e615c7df9638a3bb9e79a93d99729150dd5a72564c3fed3528e63fe70dc920a3","observation_id":"95b2e17e-757a-4020-89d4-9b664dd65e0c","resolution":{"observed_at":"2026-08-03T16:24:04.941472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19759","last_updated":"2024-12-30T08:43:06Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:59:47Z","title":"MotionLCM: Real-time Controllable Motion Generation via Latent Consistency Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19759","snapshot_observed_at":"2026-08-03T16:24:05.142966Z","title":"Motionlcm: Real-time control- lable motion generation via latent consistency model.arXiv preprint arXiv:2404.19759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.142966Z"},"links":{"cited_paper":"/paper/2404.19759","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:b7c5d7801fda4fa1043c6dc56909a2b8b394e5752fde1f1afe4f8c7374525631","observation_id":"d2560a55-a3ca-43e6-89e8-7ba504f697cd","resolution":{"observed_at":"2026-08-03T16:24:05.142966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:05.305002Z","title":"Sigmoid- weighted linear units for neural network function approx- imation in reinforcement learning.Neural networks, 107: 3–11, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.305002Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:a32ce210a6fdd49f48be465d689d754665a5d54e58bff6a3596f853bb73623fd","observation_id":"bb1b93a2-bec8-4f22-9543-e8a3e6da7d5b","resolution":{"observed_at":"2026-08-03T16:24:05.305002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-03T02:37:38.651864Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-03T16:24:05.477812Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens.arXiv preprint arXiv:2410.13863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.477812Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:5382eedd46816666df6e173ee45be99a60f1ee0d7dceef6518f7ec2360276b13","observation_id":"9bf1fc10-c7fb-4d52-9cb6-3a634dc38829","resolution":{"observed_at":"2026-08-03T16:24:05.477812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:05.671489Z","title":"Remos: 3d motion- conditioned reaction synthesis for two-person interactions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.671489Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:63015e2291c943449603d17a17555121d8ff2ebca3b3ee3b728f4097d148ddf3","observation_id":"2bb6e701-839e-45d6-89cc-b3f0e54367f8","resolution":{"observed_at":"2026-08-03T16:24:05.671489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:05.788186Z","title":"Duetgen: Music driven two-person dance generation via hierarchical masked modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.788186Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:c1be4e09086e0696b11f8ff8c2e8e72ada965eeb1b66cfbec6698331052fc299","observation_id":"d0656859-f318-4303-9712-9517bd1c42d9","resolution":{"observed_at":"2026-08-03T16:24:05.788186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:05.882970Z","title":"Ac- tion2motion: Conditioned generation of 3d human motions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.882970Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:37c1cd07dcbb26b3beab6353e266fcc8f5410dbbf4f667bc72030334ce390ece","observation_id":"8ad7661a-6c1e-4505-ac79-3a9fa36653ac","resolution":{"observed_at":"2026-08-03T16:24:05.882970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:05.958262Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:05.958262Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:1aee9fb965f60f0e24a1f4bd350ccc3a35d04d0dbc23329dfd774c9763c51014","observation_id":"2a68a7d8-1ced-497c-ab1f-1ce09069a97e","resolution":{"observed_at":"2026-08-03T16:24:05.958262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.065819Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal genera- tion of 3d human motions and texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.065819Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3daad55c875b326ad051b8f0fb49d53fe16164fb0bc38a155c153632b8cb2546","observation_id":"500be64b-7553-4e2c-a31d-6231a002e81f","resolution":{"observed_at":"2026-08-03T16:24:06.065819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.129384Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.129384Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:64fcb1a1d8bc48f5a18fb46cf8de9153dbc77d054898fa60ba8c05c98a449aef","observation_id":"d8dde565-95a5-40ce-947d-fcc4dad2edc5","resolution":{"observed_at":"2026-08-03T16:24:06.129384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.256735Z","title":"Snap- mogen: Human motion generation from expressive texts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.256735Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:dc80b2bd856d3b9fbcba0a8c10c01c69b55eade7f0bee0e60abc4259c05db15f","observation_id":"a4339814-6bea-4c3b-8d20-cde926f6b691","resolution":{"observed_at":"2026-08-03T16:24:06.256735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.354084Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.354084Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:13443ebeaa2b14ddbf70629ac3d69ef1c24cb463b18ee4febabfb410d3512a37","observation_id":"f122d265-da61-4c80-bff0-2f53fc159914","resolution":{"observed_at":"2026-08-03T16:24:06.354084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18127","last_updated":"2024-09-26T17:59:31Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:59:31Z","title":"EgoLM: Multi-Modal Language Model of Egocentric Motions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18127","snapshot_observed_at":"2026-08-03T16:24:06.432236Z","title":"Egolm: Multi-modal language model of egocentric motions.arXiv preprint arXiv:2409.18127, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.432236Z"},"links":{"cited_paper":"/paper/2409.18127","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:4f73fd92f0d1c7363a1744941d0294e0aa81ca5611a5c2a7ff826ad8ec8c36a2","observation_id":"f7c17780-9744-4dd2-a530-83f1ffa54ef0","resolution":{"observed_at":"2026-08-03T16:24:06.432236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.512963Z","title":"Stablemofusion: Towards robust and efficient diffusion-based motion generation framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.512963Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8fb19ae438e716c359a6ac12d58494bfd4ce8f4b307737c9bb7f964b188b91fe","observation_id":"6de5782f-48a2-45c2-a836-74e74da17d26","resolution":{"observed_at":"2026-08-03T16:24:06.512963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10010","last_updated":"2025-03-02T07:42:20Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T21:11:04Z","title":"InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10010","snapshot_observed_at":"2026-08-03T16:24:06.609967Z","title":"Intermask: 3d human interaction generation via collabo- rative masked modelling.arXiv preprint arXiv:2410.10010,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.609967Z"},"links":{"cited_paper":"/paper/2410.10010","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3969653f07cf1ac5dbbc0303817493c3b4ed8e87388e0c3f935770b20a9a8cc1","observation_id":"ddaf58e9-7c0b-433f-a344-b47e606a44f5","resolution":{"observed_at":"2026-08-03T16:24:06.609967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.672025Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.672025Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:0b566174ca8024b410004b278636602e3d24bc395541cc7cf357086ffaae5105","observation_id":"cde53a3d-066c-407f-8a97-8143423318c6","resolution":{"observed_at":"2026-08-03T16:24:06.672025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19083","last_updated":"2025-03-08T15:06:47Z","snapshot_observed_at":"2026-08-04T21:18:09.372954Z","submitted_at":"2025-01-31T12:17:04Z","title":"MotionPCM: Real-Time Motion Synthesis with Phased Consistency Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19083","snapshot_observed_at":"2026-08-03T16:24:06.756769Z","title":"Motionpcm: Real-time motion synthesis with phased consistency model.arXiv preprint arXiv:2501.19083, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.756769Z"},"links":{"cited_paper":"/paper/2501.19083","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:aea19c6a7938d9750c46d76e9dcc3ea066e0bb544ef13c6d0c7d06de0638b7ef","observation_id":"e2200bee-99fe-4219-9f51-c861601a0074","resolution":{"observed_at":"2026-08-03T16:24:06.756769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.854335Z","title":"Guided motion diffusion for con- trollable human motion synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.854335Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:d8247abb52aeddd913b43c4430c8adc6ed08cb07cf57763a87f21ae0829d0eb9","observation_id":"feee44ab-cf03-46e8-9ba9-8e93b3bc5d04","resolution":{"observed_at":"2026-08-03T16:24:06.854335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:06.912633Z","title":"Latent diffusion models with masked autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:06.912633Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:4e6e4ad3860eef9702450e03de9393d1071450f9bb0918d1dd243f0bca6b6f03","observation_id":"53e12b1f-158d-4c3f-bd6a-807acd9e4399","resolution":{"observed_at":"2026-08-03T16:24:06.912633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.005968Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.005968Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:384a06b084aa2617fcdcbf1037d36b47dbe23df7b1b5bdbcdaf2c845f802976b","observation_id":"8e38ae91-c8b5-4796-b1f1-1596b340fd8f","resolution":{"observed_at":"2026-08-03T16:24:07.005968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15904","last_updated":"2024-09-30T10:39:38Z","snapshot_observed_at":"2026-08-05T13:28:25.630407Z","submitted_at":"2024-09-24T09:20:06Z","title":"Unimotion: Unifying 3D Human Motion Synthesis and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15904","snapshot_observed_at":"2026-08-03T16:24:07.113970Z","title":"Unimotion: Unifying 3d human motion synthesis and understanding.arXiv preprint arXiv:2409.15904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.113970Z"},"links":{"cited_paper":"/paper/2409.15904","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:6b57ae34270c06007e84634bfd10a160a5ec9a898fbf978ffddedb26a2861b43","observation_id":"95b75009-b807-4610-b64f-2ec81da94412","resolution":{"observed_at":"2026-08-03T16:24:07.113970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.230200Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.230200Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:a9c9a6b365bdc1aa41e75f02ca38cd053898f6a2f12b676d4160880125698c8a","observation_id":"a6e48cb5-f41c-4369-a8eb-a419b9968de7","resolution":{"observed_at":"2026-08-03T16:24:07.230200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.355999Z","title":"Intergen: Diffusion-based multi-human motion gener- ation under complex interactions.International Journal of Computer Vision, pages 1–21, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.355999Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:7014e81d7eb8e8d7a3513fbf60dce19bf3feacb3891efe1c72d8d72d417e2d44","observation_id":"3522cd83-8a5d-40da-ae3b-8a7f2d01a2db","resolution":{"observed_at":"2026-08-03T16:24:07.355999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.471224Z","title":"Character controllers using motion vaes.ACM Trans","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.471224Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:d2b67c4d4c79e949fb73a56e26210fedd24f3c5c8596fd044f95269a3a980a8c","observation_id":"44746425-7878-4ece-9a4c-b486e2f69bd3","resolution":{"observed_at":"2026-08-03T16:24:07.471224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-08-03T16:24:07.533226Z","title":"Gesturelsm: Latent shortcut based co-speech gesture generation with spatial-temporal modeling.arXiv preprint arXiv:2501.18898, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.533226Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:2dc8e9612220be8434f8a2cbea23a47ef5a8675788fa6203fdf91a0e15738e02","observation_id":"fd85416b-08b0-41ab-b5ea-7b50414bd5c9","resolution":{"observed_at":"2026-08-03T16:24:07.533226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T16:24:07.623874Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.623874Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:30b803b058c4bfacc84711500bd300ab282fe529bd1c63b58e4377099202bb3d","observation_id":"552b237c-e8f4-4579-8272-052a1a95a16a","resolution":{"observed_at":"2026-08-03T16:24:07.623874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.696711Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.696711Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:d1fe067fd43d46c73f483e967f8063d485dc42b58e2d8d5b2b7781c5f0ee93dc","observation_id":"ab72fc35-ef71-49b6-840d-5f0e43f29fca","resolution":{"observed_at":"2026-08-03T16:24:07.696711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.777266Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.777266Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:af8205c1f673652d4361cc178d16be31ab70a3a9ccd8e437f3d64fefd93a7dc0","observation_id":"cf7c807b-b1d2-433f-b7ea-7e2fc8184453","resolution":{"observed_at":"2026-08-03T16:24:07.777266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:07.846864Z","title":"Troje, Ger- ard Pons-Moll, and Michael J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.846864Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:4582ac5e98a88ce42f04afa86de608c779471112cb5f36e30e1d4fdce9200881","observation_id":"c9eee30f-b0d2-46d0-a414-e45cd0cb92e9","resolution":{"observed_at":"2026-08-03T16:24:07.846864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-03T16:24:07.941088Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning.arXiv preprint arXiv:2108.10470, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.941088Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:5cbc8c602eb0c9170f78e2ff3e52dabcbd38db85fa17f4885b8b499d86f9c5c3","observation_id":"74e3c396-5008-4c7b-a42e-5765a4f19a2c","resolution":{"observed_at":"2026-08-03T16:24:07.941088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16575","last_updated":"2025-07-08T20:15:01Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T16:59:42Z","title":"Rethinking Diffusion for Text-Driven Human Motion Generation: Redundant Representations, Evaluation, and Masked Autoregression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16575","snapshot_observed_at":"2026-08-03T16:24:08.027036Z","title":"Rethinking diffusion for text-driven human motion generation.arXiv preprint arXiv:2411.16575, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.027036Z"},"links":{"cited_paper":"/paper/2411.16575","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:74fab6fc381d203273fe70fcb6a518e6954a63cef659c354a98b4d39e9fb9535","observation_id":"17d8d5b7-6ac0-4414-845d-de473cd02d6c","resolution":{"observed_at":"2026-08-03T16:24:08.027036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19377","last_updated":"2025-05-30T19:54:43Z","snapshot_observed_at":"2026-08-07T14:13:03.871224Z","submitted_at":"2025-05-26T00:36:00Z","title":"Absolute Coordinates Make Motion Generation Easy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19377","snapshot_observed_at":"2026-08-03T16:24:08.124968Z","title":"Absolute coordinates make motion generation easy.arXiv preprint arXiv:2505.19377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.124968Z"},"links":{"cited_paper":"/paper/2505.19377","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:a401129ba9fc48c6690a2c772c99e5d25fefaf9c545adb1ada6932abf0b6d265","observation_id":"796af298-a87d-4a84-8c22-9e9e49074bb6","resolution":{"observed_at":"2026-08-03T16:24:08.124968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.228130Z","title":"Semantic-vae: Semantic- alignment latent representation for better speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.228130Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:d7997981842aff8e53cab6b8641d86a47e9e9fff7b6662db998e7a72417d94cd","observation_id":"5da4460c-2afc-400e-821f-a517d3798f98","resolution":{"observed_at":"2026-08-03T16:24:08.228130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.285396Z","title":"Black, and Gül Varol","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.285396Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:1eda1514d9d0be0dd018d0a45926d5b88045aaeb627c70cd04bad1666173e8fe","observation_id":"4c7550f9-5783-497e-a054-e914a4f0927c","resolution":{"observed_at":"2026-08-03T16:24:08.285396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08559","last_updated":"2024-05-24T17:28:19Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T18:39:15Z","title":"Multi-Track Timeline Control for Text-Driven 3D Human Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08559","snapshot_observed_at":"2026-08-03T16:24:08.385589Z","title":"Stmc: Multi- track timeline control for text-driven 3d human motion gener- ation.arXiv preprint arXiv:2401.08559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.385589Z"},"links":{"cited_paper":"/paper/2401.08559","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:971c4c154cb4225b87157b9b64f9d5fa5377451557b50782a2c1f055332a7b8e","observation_id":"133c7278-3e89-46ec-9773-ac35b35361ae","resolution":{"observed_at":"2026-08-03T16:24:08.385589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.513645Z","title":"Bamm: bidirectional autoregressive motion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.513645Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:e22dd887dc27582d853cea60ab276e69c4fdd4d1d9fa27c96f0e792098c635d2","observation_id":"f72de259-028d-470a-af06-d99a86ed81f6","resolution":{"observed_at":"2026-08-03T16:24:08.513645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.612633Z","title":"Mmm: Generative masked motion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.612633Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8dbedbdf6eab73b13b4608906b349d5550c5085b849abbe90f8adc6e67d8e5d0","observation_id":"9a75b0d5-58a7-4464-8572-92806bf6c917","resolution":{"observed_at":"2026-08-03T16:24:08.612633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.742197Z","title":"Maskcon- trol: Spatio-temporal control for masked motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.742197Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8f618e429bd1051c974ab8dd7a46d5098d69eef96837eab55465ff2b77579d1c","observation_id":"ebe1bd90-062c-4c69-979e-61c09b980d85","resolution":{"observed_at":"2026-08-03T16:24:08.742197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:08.844155Z","title":"The kit motion-language dataset.Big data, 4(4):236–252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:08.844155Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:2831ee208b6239c9cb2cb5848a3f496b0eb2d095805ad421c15d4267d69205be","observation_id":"2606617c-b3ae-46e0-81ca-8e3e3bdf5c32","resolution":{"observed_at":"2026-08-03T16:24:08.844155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.011842Z","title":"Punnakkal, Arjun Chandrasekaran, Nikos Athanasiou, Alejandra Quiros-Ramirez, and Michael J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.011842Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3b7740f5653ae66b478010e826878e960c6c0593650a031ec42c1e24e5d8d095","observation_id":"fd5d865c-8258-4930-b214-32c2363e92f6","resolution":{"observed_at":"2026-08-03T16:24:09.011842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.104171Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.104171Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3d4972fdceca81064c559b12d183c8a11a114e6ee4ca19c70b9f63f66ce5ab9b","observation_id":"443da5bf-369d-46d8-92ad-ea50d06d5ab3","resolution":{"observed_at":"2026-08-03T16:24:09.104171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.180075Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.180075Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:7c1e3cfa144f83a72127a876e5125f66fdf04f5bfe1b79ca057f69cab7ee1444","observation_id":"cccad4eb-ed1e-40cd-bf17-405749bfe821","resolution":{"observed_at":"2026-08-03T16:24:09.180075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.254750Z","title":"Humor: 3d human motion model for robust pose estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.254750Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:0b7418bcf496a1dd1fa9da54e1c8f4b992415b8e34adc946b8ddf64d55bd45c2","observation_id":"351a0577-5a89-4a14-9a8d-33f7dcc7abc4","resolution":{"observed_at":"2026-08-03T16:24:09.254750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.316923Z","title":"Priormdm: Human motion diffusion as a generative prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.316923Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:bf72b1da9fddda2e200dcfc5fa03b64d64b9fbd6c5682889976b841281ddb4c2","observation_id":"ef994afd-b8c7-4189-a9a1-92b80667de12","resolution":{"observed_at":"2026-08-03T16:24:09.316923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.404757Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.404757Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:b947f6995d171bbe4bea68389dc57fa40ed7529d67eca776686a86276301853b","observation_id":"2119b3ff-3e0d-4577-b969-5410d93d366d","resolution":{"observed_at":"2026-08-03T16:24:09.404757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.534994Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.534994Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:4caf00bb33a30f23523d0c6355cbdc4aad0e1121a22176c25337799c1b739502","observation_id":"8148a499-f86a-476f-97b3-4daee30c879a","resolution":{"observed_at":"2026-08-03T16:24:09.534994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.600789Z","title":"Autoregressive motion generation with gaussian mixture-guided latent sampling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.600789Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:64eba20136cff84b96b43be8e23bac42dcbee89568b144d930d2d4ec17a0c01a","observation_id":"1315e708-fc83-42d8-b715-6037dbe75803","resolution":{"observed_at":"2026-08-03T16:24:09.600789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.709734Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.709734Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:b5a5e959bda2f84782a23970c9d3c71d5c326552b685f236eeb9d2162b2eab7b","observation_id":"e7494b57-da98-4e15-96c8-d00934cc81da","resolution":{"observed_at":"2026-08-03T16:24:09.709734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.844393Z","title":"What is the best automated metric for text to motion generation? InSIGGRAPH Asia 2023 Conference Papers, pages 1–11, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.844393Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:2404ffe2f2037958e3865f219052fdb6e695d019f45c0e2fa4ea78ea4205c6e5","observation_id":"c006302d-b6da-4a22-a3f8-d2390c3d8a9f","resolution":{"observed_at":"2026-08-03T16:24:09.844393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:09.967630Z","title":"Tlcontrol: Trajectory and language control for human motion synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:09.967630Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:fc756b5020bec6ec8f10308569929d60334c4658d703ee1d7bb09c25800cd044","observation_id":"9b9637f9-3b59-48e0-9140-4da8f0f7a35d","resolution":{"observed_at":"2026-08-03T16:24:09.967630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.066080Z","title":"Aligning motion generation with human perceptions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.066080Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3f5950239bd3f21a461abd4cf6c9b462097fa450234f497d39746cb20eee56cc","observation_id":"d3c2e867-fc0f-4ec8-9df0-8c25365c9d6b","resolution":{"observed_at":"2026-08-03T16:24:10.066080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.181861Z","title":"Mo- tiondreamer: One-to-many motion synthesis with localized generative masked transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.181861Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:b6e105013e6de4d8acb1ddf7aec2cfb370b0d642055e2bd223b36c183af0ab93","observation_id":"1097fc41-7e0e-4758-b198-c2e45bdc75e5","resolution":{"observed_at":"2026-08-03T16:24:10.181861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.278570Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.278570Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:de1467b5805fb44b7aaa0e980fe0d858f82f201785ec96a583cb71bb3122c64f","observation_id":"7b53a770-e00f-4bf4-b084-6ab42ebefae7","resolution":{"observed_at":"2026-08-03T16:24:10.278570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15451","last_updated":"2025-08-07T05:21:41Z","snapshot_observed_at":"2026-08-07T16:51:08.325643Z","submitted_at":"2025-03-19T17:32:24Z","title":"MotionStreamer: Streaming Motion Generation via Diffusion-based Autoregressive Model in Causal Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15451","snapshot_observed_at":"2026-08-03T16:24:10.411863Z","title":"Motionstreamer: Streaming motion genera- tion via diffusion-based autoregressive model in causal latent space.arXiv preprint arXiv:2503.15451, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.411863Z"},"links":{"cited_paper":"/paper/2503.15451","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:c283408a3cf5608777e5f6af9a0a310a1ff6f83c2f872403b6f15cf381e90e24","observation_id":"a55b684c-4ee6-4cc2-a8fe-b443a4711d4c","resolution":{"observed_at":"2026-08-03T16:24:10.411863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.518066Z","title":"Representa- tion alignment for generation: Training diffusion transform- ers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.518066Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:0f18f8e84e8f1dc89c1289aa1d5cf6a58b22c8b513968efd87fd7c32f0979b34","observation_id":"8890e7db-9003-46b7-9e25-0db9230f3e9d","resolution":{"observed_at":"2026-08-03T16:24:10.518066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09667","last_updated":"2025-09-11T17:58:18Z","snapshot_observed_at":"2026-08-04T18:50:54.396744Z","submitted_at":"2025-09-11T17:58:18Z","title":"Geometric Neural Distance Fields for Learning Human Motion Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09667","snapshot_observed_at":"2026-08-03T16:24:10.602170Z","title":"Geometric neural distance fields for learning human motion priors.arXiv preprint arXiv:2509.09667, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.602170Z"},"links":{"cited_paper":"/paper/2509.09667","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:80d26f874f0b2258436360b80c296afb4147c791a98039d55d90bed7729a77c5","observation_id":"ba0271bc-a01a-4b74-9025-712dbe5260df","resolution":{"observed_at":"2026-08-03T16:24:10.602170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.700190Z","title":"Mogents: Motion generation based on spatial-temporal joint modeling.Advances in Neural Information Processing Sys- tems, 37:130739–130763, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.700190Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:4efc60f6709fca87da800037ab5347cea8c616e876eb2008989ad944859a42af","observation_id":"fb651120-b876-4291-ac4c-e1d42fd3fbbd","resolution":{"observed_at":"2026-08-03T16:24:10.700190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:10.886656Z","title":"T2m-gpt: Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:10.886656Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:eb4733b71a104ae314cc1651c757f6930384569d7fe90f6e127ce8a973a963ca","observation_id":"9de634a0-f34b-4b62-a183-f32ececbf7e4","resolution":{"observed_at":"2026-08-03T16:24:10.886656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-05T16:54:24.959919Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-03T16:24:11.014828Z","title":"Motiondiffuse: Text- driven human motion generation with diffusion model.arXiv preprint arXiv:2208.15001, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.014828Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:f3485ba1b310bff07973d66c89a562123421e82df98d5eb4d92cd916d577b72e","observation_id":"8fe4e2a9-55b4-4777-8526-eaed33bad137","resolution":{"observed_at":"2026-08-03T16:24:11.014828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01116","last_updated":"2023-04-03T16:29:00Z","snapshot_observed_at":"2026-07-06T15:11:32.429514Z","submitted_at":"2023-04-03T16:29:00Z","title":"ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01116","snapshot_observed_at":"2026-08-03T16:24:11.054177Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.054177Z"},"links":{"cited_paper":"/paper/2304.01116","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:938df180044a39bb7bba0c2f9ca57238ba5bfa1a71acee61db131e5a2bf6fd92","observation_id":"a97f50a1-a42e-4b24-b107-1085b065e2a1","resolution":{"observed_at":"2026-08-03T16:24:11.054177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.116136Z","title":"Finemogen: Fine-grained spatio- temporal motion generation and editing.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.116136Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:3fa36c8fdecd81cb05b505fb5647c8dadbecfa7d28793461117168972bf88893","observation_id":"1cfd3a79-cb74-4a3d-81e4-acec8474cf5b","resolution":{"observed_at":"2026-08-03T16:24:11.116136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.172665Z","title":"Large motion model for unified multi-modal motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.172665Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:56f38ef52e379a85dd3bc9e764c3dd4560c9931d25b2e1879c02cd5633a5ba39","observation_id":"9ea33396-92b5-485b-b34d-1c241feaf3c4","resolution":{"observed_at":"2026-08-03T16:24:11.172665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.237336Z","title":"Kinmo: Kinematic-aware human motion understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.237336Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:815eb55979f849c87e46b8c8ea36e3ee003dae52a22c45aec7150e98b3453d9d","observation_id":"87a09bf8-8439-4e02-ae09-ea8416f9e804","resolution":{"observed_at":"2026-08-03T16:24:11.237336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.352010Z","title":"Flashmo: Geometric interpolants and frequency-aware sparsity for scalable efficient motion gen- eration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.352010Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:6d559b582f172b35afe97bccfbe6e07135b18044f5faa621eee65bb9956e8cb1","observation_id":"34014912-a6bf-4c13-95cd-f4183c414b35","resolution":{"observed_at":"2026-08-03T16:24:11.352010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07487","last_updated":"2024-08-03T07:48:15Z","snapshot_observed_at":"2026-08-04T06:09:40.935616Z","submitted_at":"2024-03-12T10:25:29Z","title":"Motion Mamba: Efficient and Long Sequence Motion Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07487","snapshot_observed_at":"2026-08-03T16:24:11.410248Z","title":"Motion mamba: Efficient and long se- quence motion generation with hierarchical and bidirectional selective ssm.arXiv preprint arXiv:2403.07487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.410248Z"},"links":{"cited_paper":"/paper/2403.07487","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:a662c341d623ad985a01f1bed5a39eedbde80fb409d101d17be4762a9b0561ba","observation_id":"bbfa6573-e3f1-4537-9e5f-b6630ff532f4","resolution":{"observed_at":"2026-08-03T16:24:11.410248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.516326Z","title":"A diffusion-based autoregressive motion model for real-time text-driven mo- tion control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.516326Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:61714f6adf9c96d7b67d85f61c6480f54190926dcb597826a1ca272869cd3540","observation_id":"d5d8f2a8-61a7-427d-a978-0f419e11c916","resolution":{"observed_at":"2026-08-03T16:24:11.516326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02256","last_updated":"2024-11-23T16:09:58Z","snapshot_observed_at":"2026-08-07T15:03:09.299755Z","submitted_at":"2023-12-04T18:58:38Z","title":"EMDM: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02256","snapshot_observed_at":"2026-08-03T16:24:11.562769Z","title":"Emdm: Efficient motion dif- fusion model for fast, high-quality motion generation.arXiv preprint arXiv:2312.02256, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.562769Z"},"links":{"cited_paper":"/paper/2312.02256","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:5545dc62c9b95f79c826b931fe54685ed4c6d7fcc2adf04a143872e415218f1b","observation_id":"b048a5b9-be58-4796-85b9-c4ed3c0ae776","resolution":{"observed_at":"2026-08-03T16:24:11.562769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.635553Z","title":"Mo- tiongpt3: Human motion as a second modality.arXiv preprint arXiv:2506.24086, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.635553Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:c393599358238af56e146a035cdbfc3b3a9207cbe5c1ea82bb2278b3ae0e604f","observation_id":"9129bf4d-fead-4b3a-8a6d-242499ec836c","resolution":{"observed_at":"2026-08-03T16:24:11.635553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.725291Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.725291Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:8cf566f71c33f73e553ba2c5e92af1e45bdd1ce35f1b89fc94c9515df5e5e776","observation_id":"38dd7408-f626-4d77-b9dd-a660c873f322","resolution":{"observed_at":"2026-08-03T16:24:11.725291Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:24:11.789786Z","title":"5 reports an ablation over dif- ferent numbers of text adapter layers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:11.789786Z"},"links":{"citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:9f3b54812f5692395f034b41942a1724e2c923090dd5eb1b0d4a22c2ca441449","observation_id":"ca55d0ee-b4c0-4293-a769-3d76d65f0b9d","resolution":{"observed_at":"2026-08-03T16:24:11.789786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T19:34:46.231363Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 3 inbound Pith citation observations for arXiv:2512.13840."}