{"as_of":"2026-08-05T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8a6c7bc2099d60e6d5a9829c9398d6dc7b963a0d7f740c047c4848d015ad3fa","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:06:59.492530Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:48:24.383009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T13:38:19.010849Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"cited_work":{"arxiv_id":"2512.10730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.10730","snapshot_observed_at":"2026-07-07T03:17:15.484473Z","title":"Irg-motionllm: Interleaving motion generation, assessment and refinement for text-to-motion generation","venue":null,"work_id":"bd4c8182-092c-408c-bb1e-2dd2a942e872","year":2025},"citing_paper":{"arxiv_id":"2604.23264","last_updated":"2026-04-25T12:16:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-25T12:16:37Z","title":"MotionHiFlow: Text-to-motion via hierarchical flow matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T08:28:42.524111Z"},"links":{"cited_paper":"/paper/2512.10730","citing_paper":"/paper/2604.23264"},"observation_digest":"sha256:94b35cd539e3a1d9787b17ca61d3a6240e90e6dfea66c81f69e0a707bf496d0c","observation_id":"51fcdd3b-a67c-4edb-aa29-dc701edf6233","resolution":{"observed_at":"2026-07-07T03:17:15.484473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"cited_work":{"arxiv_id":"2512.10730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.10730","snapshot_observed_at":"2026-07-07T03:17:15.484473Z","title":"Irg-motionllm: Interleaving motion generation, assessment and refinement for text-to-motion generation","venue":null,"work_id":"bd4c8182-092c-408c-bb1e-2dd2a942e872","year":2025},"citing_paper":{"arxiv_id":"2605.00517","last_updated":"2026-05-01T08:43:16Z","snapshot_observed_at":"2026-08-02T21:36:47.489814Z","submitted_at":"2026-05-01T08:43:16Z","title":"PhysiGen: Integrating Collision-Aware Physical Constraints for High-Fidelity Human-Human Interaction Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T19:37:17.532483Z"},"links":{"cited_paper":"/paper/2512.10730","citing_paper":"/paper/2605.00517"},"observation_digest":"sha256:8dcafcbd000f49605d2663a907b4a0566d38ab6c207f4d15a9ee99f15eb22f7e","observation_id":"02ef9edf-2da4-4b9e-ae42-f3ac17fb813e","resolution":{"observed_at":"2026-07-07T03:17:15.484473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"cited_work":{"arxiv_id":"2512.10730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.10730","snapshot_observed_at":"2026-07-07T03:17:15.484473Z","title":"Irg-motionllm: Interleaving motion generation, assessment and refinement for text-to-motion generation","venue":null,"work_id":"bd4c8182-092c-408c-bb1e-2dd2a942e872","year":2025},"citing_paper":{"arxiv_id":"2606.11656","last_updated":"2026-06-25T06:35:40Z","snapshot_observed_at":"2026-08-04T04:04:48.584093Z","submitted_at":"2026-06-10T04:38:35Z","title":"MoGeFlow: Flowing Through Motion Codebook Geometry for Text-to-Motion Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T07:48:24.383009Z"},"links":{"cited_paper":"/paper/2512.10730","citing_paper":"/paper/2606.11656"},"observation_digest":"sha256:640855dbb17322ed63fc7b817e4c7e5b8a8e8ea212a5ecfd96108ae7a81b1916","observation_id":"c10062a6-4f09-4839-acca-55a1d4bbf1c9","resolution":{"observed_at":"2026-07-07T03:17:15.484473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.10730/citation-record","integrity":"/paper/2512.10730/integrity","json":"/paper/2512.10730/citation-record.json","paper":"/paper/2512.10730"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.468656Z","title":"interleaving reasoning: Next-generation reasoning systems for agi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.468656Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:076725170f92baa3ed60d2baa3480edafa4be67062f96a17eacac6bcba5e1cf6","observation_id":"39706b0b-38f4-4472-ae15-b8282580ed04","resolution":{"observed_at":"2026-08-03T17:06:54.468656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.494641Z","title":"introducing openai o3 and o4-mini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.494641Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:2d9f7872c3ce69ecdcd218fd58d17cea324fb1f7577cb0dd7e470397d8865228","observation_id":"14a01c19-6505-4761-8447-6b4ca20de224","resolution":{"observed_at":"2026-08-03T17:06:54.494641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-04T20:48:44.278858Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-08-03T17:06:54.531502Z","title":"Being-m0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.531502Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d9854a685be336e70aead5e6e4b43c2dafd537b43d248e741e0db64cd503a01f","observation_id":"f3f0f2b1-ba20-4233-91d7-cb8d54d2cfd2","resolution":{"observed_at":"2026-08-03T17:06:54.531502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.571153Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.571153Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:197456a917405ccc2fff424e88b71692d9055b08a90ba4c874a3433be4408891","observation_id":"c40a33fc-fa13-4c37-bbe4-e6b2a1f0b6ca","resolution":{"observed_at":"2026-08-03T17:06:54.571153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-04T09:56:28.937130Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22525","snapshot_observed_at":"2026-08-03T17:06:54.616428Z","title":"Thinking with gen- erated images.arXiv preprint arXiv:2505.22525, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.616428Z"},"links":{"cited_paper":"/paper/2505.22525","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:dd89d50659e2f64aac0ec42aeea76a344fc7d07ffab7494f0142a99483bb73f0","observation_id":"4dd8abe7-10b0-41ed-88cd-7c1ed1d406fc","resolution":{"observed_at":"2026-08-03T17:06:54.616428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T17:06:54.649241Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.649241Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:8e3a14fc8117b2006f5811ebecfca96292bca3b510f83b12e1ad6a4249d8613c","observation_id":"39f27fc0-ab1e-4e0f-9d1b-5e791a24044c","resolution":{"observed_at":"2026-08-03T17:06:54.649241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.691255Z","title":"Go to zero: Towards zero-shot motion generation with million-scale data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.691255Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:f07c9557d5aac874d1f1b7b0119fdf4767ec56b9dead510dddb6b5ae3557dbd5","observation_id":"95ba3741-eed0-46fb-a25a-14a436173334","resolution":{"observed_at":"2026-08-03T17:06:54.691255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-07-06T20:52:14.274575Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T17:06:54.722954Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.722954Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:2d2b39d6ebeca316611ec7ff03ffcccbdf8a826b2f066fda7bafa985cc7f64a9","observation_id":"b5450353-038d-4dac-a264-4d7fa7247780","resolution":{"observed_at":"2026-08-03T17:06:54.722954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.766830Z","title":"Love-r1: Advancing long video understanding with an adaptive zoom-in mechanism via multi-step reasoning.arXiv preprint arXiv:2509.24786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.766830Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:2eb14a4ce29392c84fb818ee620e8c51b12e914de15b099da579a1e0ad404394","observation_id":"2af2d311-aeac-4bed-9644-aa2dee621322","resolution":{"observed_at":"2026-08-03T17:06:54.766830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.803346Z","title":"Reasoning robustness of llms to adversar- ial typographical errors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.803346Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:66eadf573051f536426e9bbea19c7db7c73e6d0db8933cb852b3b9e7d2b49f1b","observation_id":"40bc1d4a-c7b9-47fd-882b-f85cad42ac1f","resolution":{"observed_at":"2026-08-03T17:06:54.803346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.840291Z","title":"Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning.arXiv preprint arXiv:2510.27492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.840291Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:7c6e6a22cbf9b5799bf50a3355fb2a316085a9deefb352e10d36335c7ccf37aa","observation_id":"0d3a67e0-af99-4a3e-a643-2ca914893159","resolution":{"observed_at":"2026-08-03T17:06:54.840291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.875620Z","title":"Ac- tion2motion: Conditioned generation of 3d human motions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.875620Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:530c68c1fb6798b3d5a82665e5c77c9da7ad4f9ab9f2e35d97e7a3ad5e0e1ca1","observation_id":"6451c3d5-9fc6-41a3-bf95-3bfaf4c40529","resolution":{"observed_at":"2026-08-03T17:06:54.875620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.895951Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.895951Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:99038800330753d03d498a469712fbe162d463a9949a2df38f217c50514dc2be","observation_id":"c34bbc13-b488-49d2-9009-72ce29bbcfb1","resolution":{"observed_at":"2026-08-03T17:06:54.895951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.934563Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal genera- tion of 3d human motions and texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.934563Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:6ce8a2ca454a4d6dd84bf6d2f95e2c40548f094b10021a03d33ae5c766a4476e","observation_id":"92817f07-3bde-4c8e-8e42-aecf80a6dd7f","resolution":{"observed_at":"2026-08-03T17:06:54.934563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:54.973758Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.973758Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:db41088e37357a79c10ce22ed39db26b6b111fc997591552d9095d9c8ac567a0","observation_id":"e64a3bc0-4c93-4f5e-8fc3-6415e2b24806","resolution":{"observed_at":"2026-08-03T17:06:54.973758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T17:06:55.006930Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.006930Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:b9e2bc7d1e4c8ae92b878de54943765414c206f70cc6f393a6d9b0b4df3d6e9d","observation_id":"c3eaaf17-b54e-40c9-9fad-9b988a50a1c8","resolution":{"observed_at":"2026-08-03T17:06:55.006930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.048469Z","title":"Atom: Aligning text-to-motion model at event-level with gpt-4vision reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.048469Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:986698dbe65ee3150d478ae3c3c5f87b128de6f897f526db7c20c2166f9fcb63","observation_id":"681df705-201f-46aa-8e51-37705bfac745","resolution":{"observed_at":"2026-08-03T17:06:55.048469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20323","last_updated":"2023-11-28T06:18:33Z","snapshot_observed_at":"2026-07-06T16:41:03.157136Z","submitted_at":"2023-10-31T09:58:11Z","title":"SemanticBoost: Elevating Motion Generation with Augmented Textual Cues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20323","snapshot_observed_at":"2026-08-03T17:06:55.060837Z","title":"Semanticboost: Elevating motion gen- eration with augmented textual cues.arXiv preprint arXiv:2310.20323, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.060837Z"},"links":{"cited_paper":"/paper/2310.20323","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:afa0ea01be64e91f74eedf0052c5fd9c77da41e773ac59086bfb688aa60c59dc","observation_id":"476f92af-868c-4705-b373-889ea28e8cbe","resolution":{"observed_at":"2026-08-03T17:06:55.060837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.097730Z","title":"Egolm: Multi-modal language model of egocentric motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.097730Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:431ec097f360fec0c2093a461716d08a430df90e6f440268023638f491811655","observation_id":"7ccbdcd6-8eb8-46bd-b900-b4c913f1ec7d","resolution":{"observed_at":"2026-08-03T17:06:55.097730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.113147Z","title":"Motionverse: A unified multimodal framework for motion comprehension, generation and edit- ing.arXiv preprint arXiv:2509.23635, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.113147Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4a1c28160770f1d9c4dd27f9f61b75947474951389ba56a2d92a9ff110326769","observation_id":"3616e3ec-ce3d-4240-baf0-17eb8c30fada","resolution":{"observed_at":"2026-08-03T17:06:55.113147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.151055Z","title":"Language is not all you need: Aligning perception with language mod- els.Advances in Neural Information Processing Systems, 36:72096–72109, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.151055Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:316beef9d9e3941bfc1ac206acb68d91b2e0c28a1cc9be0a3ebdb731c750da9e","observation_id":"61469251-2f0d-4e8d-a01d-e8a6b39f7596","resolution":{"observed_at":"2026-08-03T17:06:55.151055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-08-03T17:06:55.166111Z","title":"Interleaving rea- soning for better text-to-image generation.arXiv preprint arXiv:2509.06945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.166111Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:8e2802af84ebadf3e3f1e0942aec6d872666d89fbefeea6b6c6bf5f5baa011cd","observation_id":"7a4ba74c-4fae-4ac1-a9d8-8357d14b0a7a","resolution":{"observed_at":"2026-08-03T17:06:55.166111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-03T17:06:55.191917Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.191917Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:eeafc10721bd52277da9afabac38ae3299724b626f8f7c656ab1b009c62a1ac7","observation_id":"503f38c9-bf4d-47f0-a401-9f09078c1398","resolution":{"observed_at":"2026-08-03T17:06:55.191917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T17:06:55.228764Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.228764Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:a31c63b37096bba4bf0f7ce0f93cd6239f83743f46115b22d2508a48bf836fb0","observation_id":"246d1d0f-e835-4b8d-aeef-214b69236a30","resolution":{"observed_at":"2026-08-03T17:06:55.228764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-04T08:01:36.583775Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03191","snapshot_observed_at":"2026-08-03T17:06:55.290791Z","title":"Multimodal generative ai with autoregressive llms for human motion understanding and generation: A way for- ward.arXiv preprint arXiv:2506.03191, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.290791Z"},"links":{"cited_paper":"/paper/2506.03191","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:33216159786c421bc0a97d30e1faebeb94b94138617155e73b9ac10571abdcbb","observation_id":"64f9dfd7-8ad4-4012-8524-0c611f135736","resolution":{"observed_at":"2026-08-03T17:06:55.290791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T17:06:55.308609Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.308609Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:b1f3082d28856be9a76729158a88d3d75e42ce149d5e6a716fdafdeb5b63ba34","observation_id":"a4bcd059-4035-4431-bf0a-cf7af3a9b4aa","resolution":{"observed_at":"2026-08-03T17:06:55.308609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.351990Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.351990Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d2465bf55f17e1f0000e2b001beaa4e2fb7b3376785fc0eb0f66806b9b7dde20","observation_id":"db5362c0-83c7-4e7d-9cc7-30d7a68e0df2","resolution":{"observed_at":"2026-08-03T17:06:55.351990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.435927Z","title":"Motionchain: Conversational motion controllers via multimodal prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.435927Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d8d57051a3a8e6cf2b8ab8501ebe0753301fc4cc72aa7b6dedbf278d54dd3c50","observation_id":"7983ab46-49a7-4f12-9159-853685ae2ef5","resolution":{"observed_at":"2026-08-03T17:06:55.435927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.520305Z","title":"Causal motion tokenizer for streaming motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.520305Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:41f7bbc7f5edb4fd547c6fe49bb96eb13165d6e9ed1a5d5a19429f418528a04a","observation_id":"55810da1-2077-49eb-aa1a-cc9b99a6786f","resolution":{"observed_at":"2026-08-03T17:06:55.520305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-03T17:06:55.560762Z","title":"T2i-r1: Reinforcing image generation with col- laborative semantic-level and token-level cot.arXiv preprint arXiv:2505.00703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.560762Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:afd32d047b2efb2841a3b727fadb211f2feb537d35c1d10f579067c26fdc22a3","observation_id":"8552b6ab-0018-4605-88eb-224b19a75e27","resolution":{"observed_at":"2026-08-03T17:06:55.560762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.618517Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified vi- sual encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.618517Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:0ed24bc5f21db7c2b7bb0fa6d462489e2688c95d49e728023e239e04ec33ee55","observation_id":"ec5a49d5-3634-44b3-a671-29ae92f45cb9","resolution":{"observed_at":"2026-08-03T17:06:55.618517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05419","last_updated":"2025-07-07T19:04:56Z","snapshot_observed_at":"2026-07-06T21:53:32.678356Z","submitted_at":"2025-07-07T19:04:56Z","title":"Motion Generation: A Survey of Generative Approaches and Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05419","snapshot_observed_at":"2026-08-03T17:06:55.658962Z","title":"Motion generation: A survey of generative approaches and benchmarks.arXiv preprint arXiv:2507.05419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.658962Z"},"links":{"cited_paper":"/paper/2507.05419","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:153349c36252790dcdf84740d20a8daf3684a70193b02172be6ed09d2061d820","observation_id":"a64a0d08-fc20-43ae-afdb-ddab3a0ab605","resolution":{"observed_at":"2026-08-03T17:06:55.658962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.724548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.724548Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:2c9e7f29340c33d2e4ecee61d5d61a9e7002397a3a1c9ddd555ce4ecc97ba6f2","observation_id":"bf018749-e329-4b9f-92e5-bf9f9e9cf553","resolution":{"observed_at":"2026-08-03T17:06:55.724548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.806855Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.806855Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:9d20b3a52261a247e8e461a20f2f8c99ed4b33cf842bafe21a9740e56a4ce16c","observation_id":"11be5b41-5d72-4447-b105-d2a0fb56b693","resolution":{"observed_at":"2026-08-03T17:06:55.806855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.853444Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.853444Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:819048dc5c8990f25939618965593162d0042b4f0edda4b166470ff6369866fe","observation_id":"37e63cca-9593-4413-ba93-bd8fd9672804","resolution":{"observed_at":"2026-08-03T17:06:55.853444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-07-06T19:30:34.984716Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-08-03T17:06:55.923921Z","title":"Lamp: Language-motion pretraining for motion generation, retrieval, and captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.923921Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:1f28103a2795570b0a84b14a2bf8984bccc593567080a572d44c7a399cb70c0e","observation_id":"27a3ff22-92db-496e-afc4-987062807ce6","resolution":{"observed_at":"2026-08-03T17:06:55.923921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:55.972279Z","title":"Re- momask: Retrieval-augmented masked motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.972279Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:96a11ef0fd634be30ec8428e7ff0d14abb308d594b7c0f91cf7d4762bb39b68b","observation_id":"f16fc800-426e-4d7b-b76a-2bd472f60d35","resolution":{"observed_at":"2026-08-03T17:06:55.972279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.052354Z","title":"Mixture-of- transformers: A sparse and scalable architecture for multi- modal foundation models.Transactions on Machine Learn- ing Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.052354Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:7715581a5d1220c05db5c21eb0bca10d61d29804b5bc79c75a3cf245e1e1cfc3","observation_id":"013db039-1faa-43a3-a59c-3c694fafee7b","resolution":{"observed_at":"2026-08-03T17:06:56.052354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04343","last_updated":"2024-12-05T17:01:09Z","snapshot_observed_at":"2026-07-06T20:02:17.096487Z","submitted_at":"2024-12-05T17:01:09Z","title":"RMD: A Simple Baseline for More General Human Motion Generation via Training-free Retrieval-Augmented Motion Diffuse","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04343","snapshot_observed_at":"2026-08-03T17:06:56.104197Z","title":"Rmd: A simple baseline for more general human motion generation via training- free retrieval-augmented motion diffuse.arXiv preprint arXiv:2412.04343, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.104197Z"},"links":{"cited_paper":"/paper/2412.04343","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:7cdaf2bde30954a41abcea8b27a3085284a449c293caf55678677a2ab10f449b","observation_id":"ed7b2763-e802-4f3d-ab09-244cbcf9d303","resolution":{"observed_at":"2026-08-03T17:06:56.104197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.201492Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.201492Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:f4b6e26ddc84f8ec58caf47f2e7740fed27476f74b0e4757b7128b9c1ae0d77d","observation_id":"f7b97cec-0c77-4c44-93fc-aae2fc3637db","resolution":{"observed_at":"2026-08-03T17:06:56.201492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.255846Z","title":"The quest for generalizable motion generation: Data, model, and evaluation.arXiv preprint arXiv:2510.26794,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.255846Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:0d0818eb7c1b2db4a9b3afa13c1040a6171be65f7f0752afb2e831f318414afc","observation_id":"5d0f902a-72c4-4bd0-bff1-b520f3c94506","resolution":{"observed_at":"2026-08-03T17:06:56.255846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.284895Z","title":"Panoptic captioning: An equivalence bridge for image and text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.284895Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:39837041f68e75ff51903677007db8cbb80747d85c3b2c44513dbf8771037869","observation_id":"cefd6232-1bb9-4583-8759-b017bdf1af4b","resolution":{"observed_at":"2026-08-03T17:06:56.284895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.362806Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.362806Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:1b56862ae5837660ad2362736559ac7addf249bfee65bf10a5a9c8386424166e","observation_id":"8eb47cc5-40ba-45b6-a6d0-d237418860e6","resolution":{"observed_at":"2026-08-03T17:06:56.362806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06513","last_updated":"2024-10-09T03:27:14Z","snapshot_observed_at":"2026-07-06T19:30:09.298718Z","submitted_at":"2024-10-09T03:27:14Z","title":"MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06513","snapshot_observed_at":"2026-08-03T17:06:56.393617Z","title":"Motionrl: Align text-to-motion generation to human preferences with multi-reward reinforcement learning.arXiv preprint arXiv:2410.06513, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.393617Z"},"links":{"cited_paper":"/paper/2410.06513","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:a9fa77aa14506392ac40918d2da74568724ee74fa7f7b941f8607a4018baf034","observation_id":"d56ceb1a-d05e-4cb3-99b8-a1149bfa99d5","resolution":{"observed_at":"2026-08-03T17:06:56.393617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.424648Z","title":"Scamo: Exploring the scaling law in au- toregressive motion generation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.424648Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:ad4a8e79165eadaa59ada35321f3a8635faaffefa669cd706dd5448c82c3102f","observation_id":"ac6fdd1b-6386-4593-bab4-16aa93303720","resolution":{"observed_at":"2026-08-03T17:06:56.424648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.439316Z","title":"M3gpt: An ad- vanced multimodal, multitask framework for motion com- prehension and generation.Advances in Neural Information Processing Systems, 37:28051–28077, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.439316Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:accfb870096fd635bd6346751688e7463893f6c17768c3fcd8632ce593a63b0c","observation_id":"e020a09b-70e5-4841-a4e1-fbd2e18c21c4","resolution":{"observed_at":"2026-08-03T17:06:56.439316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.470755Z","title":"Troje, Ger- ard Pons-Moll, and Michael J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.470755Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d484e2724b79d795d5153da66f8d51d5f0de0d5908053070980176266e67d611","observation_id":"e2bdef08-3e10-44e4-8c55-8c298fbab5a6","resolution":{"observed_at":"2026-08-03T17:06:56.470755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15541","last_updated":"2024-05-24T13:29:12Z","snapshot_observed_at":"2026-07-06T18:19:21.735356Z","submitted_at":"2024-05-24T13:29:12Z","title":"Learning Generalizable Human Motion Generator with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15541","snapshot_observed_at":"2026-08-03T17:06:56.489597Z","title":"Learning generalizable human mo- tion generator with reinforcement learning.arXiv preprint arXiv:2405.15541, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.489597Z"},"links":{"cited_paper":"/paper/2405.15541","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4c4b41ab53a2ee984fe3c3d64dbef68c28801cd1f6a33caeb3abde7633e8eb6c","observation_id":"b7c950a1-370e-4da6-b2d7-395bb958baa5","resolution":{"observed_at":"2026-08-03T17:06:56.489597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16575","last_updated":"2025-07-08T20:15:01Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T16:59:42Z","title":"Rethinking Diffusion for Text-Driven Human Motion Generation: Redundant Representations, Evaluation, and Masked Autoregression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16575","snapshot_observed_at":"2026-08-03T17:06:56.526984Z","title":"Rethinking diffusion for text-driven human motion generation.arXiv preprint arXiv:2411.16575, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.526984Z"},"links":{"cited_paper":"/paper/2411.16575","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:07a707400516b34a14b94f18145fabb0b0469e9bf0714735cfc80b7a227c2cc0","observation_id":"05a5ca0d-c982-4677-bc24-b23ef8781cd1","resolution":{"observed_at":"2026-08-03T17:06:56.526984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19377","last_updated":"2025-05-30T19:54:43Z","snapshot_observed_at":"2026-08-03T19:32:21.290908Z","submitted_at":"2025-05-26T00:36:00Z","title":"Absolute Coordinates Make Motion Generation Easy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19377","snapshot_observed_at":"2026-08-03T17:06:56.583534Z","title":"Absolute coordinates make motion generation easy.arXiv preprint arXiv:2505.19377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.583534Z"},"links":{"cited_paper":"/paper/2505.19377","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:2d54f6caca96ecb042c1421eed42628b610819aaa1a2e387782e6143f606c215","observation_id":"e52ab111-83f5-42c7-8ff1-07f288eb7288","resolution":{"observed_at":"2026-08-03T17:06:56.583534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.629456Z","title":"Motion-r1: Chain-of-thought reasoning and reinforcement learning for human motion generation.arXiv preprint arXiv:2506.10353, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.629456Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:27c8a2def87e141a303096900877a4886e28d1ea01536135e2cec790bdecd543","observation_id":"ddfaad43-dd4e-439d-b562-8aff80efb619","resolution":{"observed_at":"2026-08-03T17:06:56.629456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.705749Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.705749Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:007c79364cec718b192d477869b9eda265dcac0b8fb9e57b2e4161677d769ad7","observation_id":"151eaa7f-21d9-4cc8-934e-ad908f1e2f0d","resolution":{"observed_at":"2026-08-03T17:06:56.705749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03803","last_updated":"2024-05-06T19:19:20Z","snapshot_observed_at":"2026-07-30T21:51:16.466284Z","submitted_at":"2024-05-06T19:19:20Z","title":"MoDiPO: text-to-motion alignment via AI-feedback-driven Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03803","snapshot_observed_at":"2026-08-03T17:06:56.758016Z","title":"Modipo: text-to-motion alignment via ai-feedback-driven direct preference optimiza- tion.arXiv preprint arXiv:2405.03803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.758016Z"},"links":{"cited_paper":"/paper/2405.03803","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:a9582973403b1470cc325b813164cf12273c77d78be36e805407f25169e4e417","observation_id":"f8e2c982-06cf-43b7-9963-5cb70619b44e","resolution":{"observed_at":"2026-08-03T17:06:56.758016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.811798Z","title":"Black, and G ¨ul Varol","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.811798Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4404bed90468a81aca39685ee59bd63bccbf337d57bd9b599e6f4e7cbb3dfdd3","observation_id":"97193441-c6cf-43aa-a1f0-609bf59bdbee","resolution":{"observed_at":"2026-08-03T17:06:56.811798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.840245Z","title":"Bamm: Bidirectional autoregressive motion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.840245Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:dded13c71b29da26a4c673c91a036a0f702934ae1e99231d5c9e0fabd7581014","observation_id":"6b094b9c-7786-443a-aebd-01b97f7775fa","resolution":{"observed_at":"2026-08-03T17:06:56.840245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.899311Z","title":"Mmm: Generative masked motion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.899311Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:9c457315f1605d4ea9cf47b7db02c193a127aa3b8c278f93e507c5ab2a180ed8","observation_id":"7734bd98-f485-4e19-b758-506b0c0463c6","resolution":{"observed_at":"2026-08-03T17:06:56.899311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:56.951973Z","title":"The kit motion-language dataset.Big data, 4(4):236–252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:56.951973Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:f86f5cc0f8e1702d13175c1a875c46b50897a105573c96aac815c4094ee39793","observation_id":"f1342a72-8a46-4d58-a56a-51b82df6328b","resolution":{"observed_at":"2026-08-03T17:06:56.951973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.041986Z","title":"Uni-cot: Towards unified chain-of-thought reasoning across text and vision.arXiv preprint arXiv:2508.05606,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.041986Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:35b3f781f5bf27f29b3ff05bb52a4f00effd5916c4311e68d68f9fc6f1b8d05e","observation_id":"5b95409a-f738-4ca7-bbc8-cafd809629ae","resolution":{"observed_at":"2026-08-03T17:06:57.041986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.095223Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.095223Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:7b68d3399a700e110480ae4721d88bedce60c9fee9c1249d973a4c016937855c","observation_id":"aec1c598-6958-4114-87b7-354d6d09eeeb","resolution":{"observed_at":"2026-08-03T17:06:57.095223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.130749Z","title":"BREAK-THE-CHAIN: Adversarial Prompting in Code Generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.130749Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:28296089ff0ea630a9d264b5fcc8ea1dc853b8465c77700a7767bdaa858cc7b9","observation_id":"3109b3af-79cd-447e-b153-1731c825b285","resolution":{"observed_at":"2026-08-03T17:06:57.130749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T17:06:57.256637Z","title":"Proximal policy optimization algo- rithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.256637Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:530a46f9629b26bc149180e9c63a136b2a707eeb712175bf0bfe005fd016b01e","observation_id":"7ae3a820-64b0-4e6b-b70c-471b899f1316","resolution":{"observed_at":"2026-08-03T17:06:57.256637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T17:06:57.312561Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.312561Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:1cc1927fd9d1edc40df66709ed3860a2e20f3f90b4e8ca83982efc84b8adcbed","observation_id":"7dbb3504-52d7-42c6-a347-818f2aff3fe4","resolution":{"observed_at":"2026-08-03T17:06:57.312561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06119","last_updated":"2025-03-08T08:16:16Z","snapshot_observed_at":"2026-07-06T20:49:04.170752Z","submitted_at":"2025-03-08T08:16:16Z","title":"Unlocking Pretrained LLMs for Motion-Related Multimodal Generation: A Fine-Tuning Approach to Unify Diffusion and Next-Token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06119","snapshot_observed_at":"2026-08-03T17:06:57.377453Z","title":"Unlocking pretrained llms for motion-related multimodal generation: A fine-tuning approach to unify diffusion and next-token prediction.arXiv preprint arXiv:2503.06119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.377453Z"},"links":{"cited_paper":"/paper/2503.06119","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:bbe1d983b5516e52695a72a2353282c2a5e82152def3c988a0c3858800398332","observation_id":"83a9ccde-6ec1-41fe-878f-e1b9bd413e0a","resolution":{"observed_at":"2026-08-03T17:06:57.377453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-03T17:06:57.456402Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.456402Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:28e8d594715d9c72feab743e948900356fdde3298dddf40145ab986225121758","observation_id":"5b10e3fd-7ce6-4045-bc81-7b0598e03b9a","resolution":{"observed_at":"2026-08-03T17:06:57.456402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-03T17:06:57.539588Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.539588Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:73d5776c92580289a0c0def318fc9cc99f1667852fcbad26fb597d1005c1f1af","observation_id":"1ae33f43-4812-4241-b29d-d0738b8f489a","resolution":{"observed_at":"2026-08-03T17:06:57.539588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.595057Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.595057Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:ee8e49fe92265ec918d4da5475ea6a72191f11fe624c897823f6bea87ce29bb1","observation_id":"3b38ec3c-2179-40d5-af80-196d76ed7d67","resolution":{"observed_at":"2026-08-03T17:06:57.595057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02272","last_updated":"2025-01-23T14:50:20Z","snapshot_observed_at":"2026-07-06T18:40:18.655063Z","submitted_at":"2024-07-02T14:01:59Z","title":"Aligning Human Motion Generation with Human Perceptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02272","snapshot_observed_at":"2026-08-03T17:06:57.660666Z","title":"Aligning human mo- tion generation with human perceptions.arXiv preprint arXiv:2407.02272, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.660666Z"},"links":{"cited_paper":"/paper/2407.02272","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:437de43f17031f9b236e081d949d85ac0f5c1ee495871dc4e5da3a9969d289d8","observation_id":"05f48c52-641f-49fa-b7d6-8897de3cb9e2","resolution":{"observed_at":"2026-08-03T17:06:57.660666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.694462Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.694462Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:a08ac04a46c8935b1de7c9d0efd181a8e9937d1e9e49f1acc25b64c2bd77effd","observation_id":"8c3842e1-3c4c-44ca-bab9-4a30815ca66e","resolution":{"observed_at":"2026-08-03T17:06:57.694462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-07-06T19:41:19.700669Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-03T17:06:57.754379Z","title":"Motiongpt-2: A general-purpose motion- language model for motion generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.754379Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4568fa0c31c2261032a08dbeb58f2a31d34535b6433acb9474b92768fda25de5","observation_id":"8f44b047-a227-4521-91b8-600e62129615","resolution":{"observed_at":"2026-08-03T17:06:57.754379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03311","last_updated":"2025-05-30T12:53:31Z","snapshot_observed_at":"2026-07-06T19:27:37.936219Z","submitted_at":"2024-10-04T10:48:54Z","title":"Scaling Large Motion Models with Million-Level Human Motions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03311","snapshot_observed_at":"2026-08-03T17:06:57.818861Z","title":"Scaling large motion models with million-level human motions.arXiv preprint arXiv:2410.03311, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.818861Z"},"links":{"cited_paper":"/paper/2410.03311","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:231ec7f6e27c1cc3d8e8073f93893757e3cf660b3510c206287ab438217cf291","observation_id":"3bf215e6-821b-47b0-8d55-b7c47ebb497e","resolution":{"observed_at":"2026-08-03T17:06:57.818861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:57.877488Z","title":"Mg-motionllm: A unified framework for motion comprehension and gener- ation across multiple granularities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.877488Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:cc489fcb231c137ade2e536e238cab2724c844c0615801e03403876217c88985","observation_id":"b1b64248-062c-431e-800d-f083d8c778ef","resolution":{"observed_at":"2026-08-03T17:06:57.877488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T17:06:57.942013Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:57.942013Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:49dd0e89a0916e4713e73d5a18f5483f8c1264e65d4a3528864cc09614f6395e","observation_id":"9b43ddf8-2a52-4ed1-8c08-51624a0e48d7","resolution":{"observed_at":"2026-08-03T17:06:57.942013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17013","last_updated":"2024-10-06T13:46:47Z","snapshot_observed_at":"2026-08-04T14:25:14.829572Z","submitted_at":"2024-05-27T09:57:51Z","title":"Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17013","snapshot_observed_at":"2026-08-03T17:06:58.004105Z","title":"Motion-agent: A conversational framework for human motion generation with llms.arXiv preprint arXiv:2405.17013, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.004105Z"},"links":{"cited_paper":"/paper/2405.17013","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4264dbce2fdfbc21cfae5e1854b26c9b508b81c9ab1c7ce1fafe354e1e4e500a","observation_id":"7d2bf71b-1dfa-40e9-b025-49f492d0fd0f","resolution":{"observed_at":"2026-08-03T17:06:58.004105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-07-06T19:58:57.119904Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-08-03T17:06:58.070074Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks.arXiv preprint arXiv:2411.19786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.070074Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:f28db14c094cdbfc862cb9bf590177118ca41f082758bf9210c98e40063b4b4d","observation_id":"18d31264-d99b-489d-a295-4f7e87275235","resolution":{"observed_at":"2026-08-03T17:06:58.070074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.131983Z","title":"Vimorag: Video-based retrieval-augmented 3d mo- tion generation for motion language models.arXiv preprint arXiv:2508.12081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.131983Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d8d34d5acac8f4c44cee7103fb0dae8c5ebc6c418d91e6cf5a3f49c0f3a40c9b","observation_id":"5da37344-61b4-4213-9462-35253f521789","resolution":{"observed_at":"2026-08-03T17:06:58.131983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.163378Z","title":"Cross-modal retrieval for motion and text via droptriple loss","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.163378Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:ff4eec650cdbd286208b0dfec5e75ad986b4c06a1a8c930824fa5ef5a2265b82","observation_id":"989bbc0d-b4b0-49a7-b020-b24727629a89","resolution":{"observed_at":"2026-08-03T17:06:58.163378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.195508Z","title":"Motionscript: Nat- ural language descriptions for expressive 3d human motions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.195508Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:c9ef4294927f6f47a1010a2caf387f0e172093e1c40bed4e6b52f0ace6146013","observation_id":"db287bc8-c77a-47f5-8af5-f26966e13914","resolution":{"observed_at":"2026-08-03T17:06:58.195508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.222277Z","title":"Exploring vision transformers for 3d human motion-language models with motion patches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.222277Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:889e566c78b15903f1eefbc9e3b01a4b685f44a4d1ef3c3dd31927a62d40fb21","observation_id":"ff4161c6-594c-4092-b9e7-0ac3713aa1be","resolution":{"observed_at":"2026-08-03T17:06:58.222277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.280456Z","title":"Remogpt: Part-level retrieval-augmented motion-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.280456Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:ace4a09b38d49d251eea46431ad30b490c0c28c87c6bade23d6d53372928e349","observation_id":"520a74da-b9fe-447f-9584-33d2d5c900e2","resolution":{"observed_at":"2026-08-03T17:06:58.280456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.316369Z","title":"Mogents: Motion generation based on spatial-temporal joint modeling.Neural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.316369Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:80441ae5e688f0cb77c04ad33b32d97f04a0ba8bcea310aa0b25fe1f11be447c","observation_id":"5e7cc3a2-4e5f-4c01-8acf-dd70d5c5bd06","resolution":{"observed_at":"2026-08-03T17:06:58.316369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.419417Z","title":"Light-t2m: A lightweight and fast model for text-to- motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.419417Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:811f6c61de72c4389e1152560d60ccbcb68dd54ae44ea31c3dbc18e9d8fd5ce3","observation_id":"1927f9bc-b7a0-4430-a37f-d95c8d35d4f7","resolution":{"observed_at":"2026-08-03T17:06:58.419417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.451040Z","title":"T2m-gpt: Generating human motion from textual de- scriptions with discrete representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.451040Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:4bdd494a24624c1a64911f2d64d7639dad65d0418cd0669918281a6649754b12","observation_id":"b473a051-3a65-42e6-bca2-6c20bae4c84e","resolution":{"observed_at":"2026-08-03T17:06:58.451040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-07-06T21:32:38.137341Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23043","snapshot_observed_at":"2026-08-03T17:06:58.520524Z","title":"Are unified vision-language models necessary: Generalization across understanding and generation.arXiv preprint arXiv:2505.23043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.520524Z"},"links":{"cited_paper":"/paper/2505.23043","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:8130bec6771c27f89f192a4736aabe222327bfe8eb1391b6834cd0b2a13a0d7f","observation_id":"46b1327c-347f-44a8-ab5b-a159e9c18129","resolution":{"observed_at":"2026-08-03T17:06:58.520524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-03T17:06:58.629156Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.629156Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:9c8d23cca0f6801d034b9a62d0f6130cc56ac06644c2d5477fe2a57821e511d5","observation_id":"dc734f14-99a3-4e84-a554-d4bfaad96df5","resolution":{"observed_at":"2026-08-03T17:06:58.629156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.681104Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.681104Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d7762516fbb8e904209064cf9f323c7bff553ce877785846d32375f48772d6ca","observation_id":"348bbb27-3649-40ba-b2ba-f2612c2501ed","resolution":{"observed_at":"2026-08-03T17:06:58.681104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.719337Z","title":"Finemogen: Fine-grained spatio- temporal motion generation and editing.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.719337Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:db74c84ab3cdf833307aed154925f6d4c48dd0c634799af536d34a196b6137ca","observation_id":"04bc7206-e17a-413f-93b7-14e3052afa31","resolution":{"observed_at":"2026-08-03T17:06:58.719337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.754206Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model.IEEE transactions on pattern analysis and machine intelligence, 46(6):4115–4128, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.754206Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d7583793f424b0f0b98f012937c43a1e827a731106242015df9bb5de6b894d03","observation_id":"af90ae4e-bacc-4a89-bace-8413dd82a6bd","resolution":{"observed_at":"2026-08-03T17:06:58.754206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-03T17:06:58.819354Z","title":"Bertscore: Evaluating text genera- tion with bert.arXiv preprint arXiv:1904.09675, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.819354Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:19ba1a733e7b42e2e3f5e4c1be25e47d4ee81e01f33e9123953ffa043b890ce9","observation_id":"aa052a42-d613-4502-a361-4286c3fc57df","resolution":{"observed_at":"2026-08-03T17:06:58.819354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.862406Z","title":"Motion mamba: Efficient and long sequence motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.862406Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:bdbf52eb9c01c7f8b99e50039289b0c8dc4e3c213eb6d4f536910788a7ab4f47","observation_id":"ec98fe80-ea8e-46eb-af43-89b3d03dd821","resolution":{"observed_at":"2026-08-03T17:06:58.862406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-07-06T22:37:12.421372Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22663","snapshot_observed_at":"2026-08-03T17:06:58.883350Z","title":"Architecture decoupling is not all you need for unified multimodal model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.883350Z"},"links":{"cited_paper":"/paper/2511.22663","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:23e75432befe9b6425933186420ff952ff61276e2aa864978d459db905922c11","observation_id":"47bcf77d-5929-42a3-9b44-4b8540134b59","resolution":{"observed_at":"2026-08-03T17:06:58.883350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.927146Z","title":"Mo- tiongpt3: Human motion as a second modality.arXiv preprint arXiv:2506.24086, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.927146Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:945de5b2e4de625091882b9dc45e5e8e06bdb5cf7d121b248ed1930efa53923c","observation_id":"446bbb04-7637-46d8-a632-23510b273b09","resolution":{"observed_at":"2026-08-03T17:06:58.927146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:58.952061Z","title":"From reflection to perfection: Scaling inference- time optimization for text-to-image diffusion models via re- flection tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.952061Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:793dd773ce968499b9f425160ebd12309e0c05c4ab4f429175f82d81dda67e00","observation_id":"baa6c661-9958-4189-a08f-d1184b81139e","resolution":{"observed_at":"2026-08-03T17:06:58.952061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.062734Z","title":"8, we provide more preliminaries about: (1) Text- to-Motion Generation task definition; (2) Motion VQV AE; (3) Motion-aware LLM; (4) GRPO-based Reinforcement Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.062734Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:6cbae8cd8f8cff82d614fbb8cdf0a6bb957c5222b4ad54e488f12c70de01978e","observation_id":"51e7fba3-351c-454b-b367-7357d1e64345","resolution":{"observed_at":"2026-08-03T17:06:59.062734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.087834Z","title":"Text-to-Motion Generation Task Definition Text-to-Motion Generation aims at generating 3D human motion aligned with the goal text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.087834Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:905b6ed45ad6eb9de0b1d77fc2c91ccc7c52eb68533c8f98481058a937c6ff15","observation_id":"c1f1516d-bcf5-4e22-8df3-d80cd34b7093","resolution":{"observed_at":"2026-08-03T17:06:59.087834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.149505Z","title":"a man is …","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.149505Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:618c30e53dddbea5b83829e56835c1389eed1f62bc2bb7f90b22d17e4d385e29","observation_id":"c5d5452e-eeb2-4c50-8805-d8fc89c1d498","resolution":{"observed_at":"2026-08-03T17:06:59.149505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.211799Z","title":"no refinement is needed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.211799Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:73bb3fe1975d42e06be8d47feabd11ad0eb97529fc77db15384b210524938c83","observation_id":"0700ee90-26cb-4192-8074-b05a9e38dc11","resolution":{"observed_at":"2026-08-03T17:06:59.211799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.277649Z","title":"No refinements needed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.277649Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:be1d3afe3448d7b1cff51ed87a4e02b18e3de2fd2cf0225bcff26a6f2eb56aa9","observation_id":"4f1f850a-70f8-4231-a88a-ae899c97b2a5","resolution":{"observed_at":"2026-08-03T17:06:59.277649Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.326427Z","title":"assessment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.326427Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:8dc290bcbafb5a0b595b844f5ec7b52c1e7c1bbb6e2f235436d7489c88a9f8a9","observation_id":"dc0a10c0-23c9-454d-845a-2a15630cb665","resolution":{"observed_at":"2026-08-03T17:06:59.326427Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.436017Z","title":"a man is …","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.436017Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:630dffb35da529cdc4f7ee842cef93ccca3ed15eec177eeba4ce21792d3688a1","observation_id":"d9852b22-cde0-4dc7-bf44-98900c374ba6","resolution":{"observed_at":"2026-08-03T17:06:59.436017Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:06:59.492530Z","title":"In this work, we take the first step to explore the novel IR- MoGen paradigm within a general VQ-based motion-aware LLM framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:59.492530Z"},"links":{"citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:7d9beb93246a2efc42284975b509dee7d788fcf39ff6ecef76c65614d0aff252","observation_id":"56186936-83b6-4712-b65f-f600d07c1ee3","resolution":{"observed_at":"2026-08-03T17:06:59.492530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T20:09:44.830407Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 3 inbound Pith citation observations for arXiv:2512.10730."}