{"as_of":"2026-08-15T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc8214ae4c4d46d8639961d2cd54b54cf8c3ff8e997b117873a7ec1ff7322e7c","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:13:40.746783Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19459/citation-record","integrity":"/paper/2411.19459/integrity","json":"/paper/2411.19459/citation-record.json","paper":"/paper/2411.19459"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:13:40.490628Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.490628Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:478326af052f97d4b335765d5c33037543c175a15133c13e7c7bf47ad90c5558","observation_id":"aa37aba5-55c7-4dd9-a31a-5c6e062c5d5e","resolution":{"observed_at":"2026-08-12T10:13:40.490628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.560913Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":"2ba3b8a7-7cd0-4048-bdea-ddd772172112","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.496525Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:836c2a060a01677ba31113996e862b3f4f6f091ab1aca1ded8468e0ed456bdd5","observation_id":"306a3257-29dd-406c-8cd3-31373c77e294","resolution":{"observed_at":"2026-08-12T10:13:41.566438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.543677Z","title":"Videocrafter1: Open diffusion models for high-quality video generation, 2023","venue":null,"work_id":"8e57a68d-9083-4b57-9ada-e129026c5966","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.501191Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f898255b714b400879e8274d11da7f2ee31005c96da5eb857b7e53f7691489c4","observation_id":"85175727-acca-46c4-a71b-ac1f02ed6e0c","resolution":{"observed_at":"2026-08-12T10:13:41.548929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T13:54:28.489740Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-12T10:13:40.506000Z","title":"Motionllm: Understanding human behaviors from human motions and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.506000Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0fd3e05515c4a2fbb5bac5bf0fbfaef31992a834bdf2043c3d49259292c47769","observation_id":"07729790-99de-4d0b-82e3-90bd3ef760d0","resolution":{"observed_at":"2026-08-12T10:13:40.506000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.511123Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.511123Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:3898005f67bcdd35accffa6bbfe290efaad71b8be82769f07c8fcce453934bd2","observation_id":"a0224a63-38ed-4c7e-b3be-ca156790713c","resolution":{"observed_at":"2026-08-12T10:13:40.511123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-14T16:45:13.572276Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-12T10:13:40.516086Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.516086Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f4da8211507ae166a086dd2106c8491a0c232698bfa28171b1f69e433a0656bf","observation_id":"30dafbfc-6158-4901-a755-c3e07ba38f99","resolution":{"observed_at":"2026-08-12T10:13:40.516086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.515658Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"81c4b3a6-f7fd-4c31-9437-d6fef490f6f4","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.521478Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:6333f8eac997fc9b701cdd37329c100ff2cc60067ec19acee6bbffcd6a003ecd","observation_id":"d5db001f-06ba-4da2-95a7-ed09bb9ec565","resolution":{"observed_at":"2026-08-12T10:13:41.520802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.498408Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"98edee19-2c0d-4898-8f9e-e649d3dd62e7","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.526877Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:884a3ca997784d26eb588bd7390ac4d155db0b293bc5a96a40e8bea313f87bf9","observation_id":"35f238d6-8ab1-4ac6-a13b-4728c237111c","resolution":{"observed_at":"2026-08-12T10:13:41.504168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.531947Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.531947Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:a61745551a77da2546ce81930575a60e9e66b440ce0dd9d5138e50993338e36f","observation_id":"d1f4abd9-4af8-4eae-98a4-29c44bee6f3e","resolution":{"observed_at":"2026-08-12T10:13:40.531947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.537129Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.537129Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:dfff0caad329ab51ee90993e236c5d149a8243aacceb8f388f931f10c8ebad39","observation_id":"4323b666-deb9-408d-96ee-8c9d1e5e353e","resolution":{"observed_at":"2026-08-12T10:13:40.537129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.459225Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"256432bf-8e36-4756-a94d-377c5ca31ed5","year":2010},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.542131Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0a677a022b2b657b2a792c163e4748af813f57e57283e5b9d6ce814497c66cbd","observation_id":"352d5eae-8fc4-4c5a-98ab-4e28f202ec68","resolution":{"observed_at":"2026-08-12T10:13:41.465326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.547207Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.547207Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:9b3ff7ad04d8c878fa8c9e75c31cbc54ff3ff2bda45415ed74680b0bdf78089b","observation_id":"3fcaea52-a3e1-422a-b8ec-8a573cf7fcb8","resolution":{"observed_at":"2026-08-12T10:13:40.547207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.430508Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"ce7ba2c0-8cd6-4107-97ed-7549b08a6571","year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.552596Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:d079e9c39777bb5b1e770eb693fc80cc6f491fc5a73c2a4fe4a4acbc9fa643d0","observation_id":"66a148ff-19f3-4270-a84d-fb56cc3e6f4e","resolution":{"observed_at":"2026-08-12T10:13:41.436014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.412861Z","title":"Learning high fi- delity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"a8018729-a3f5-48f4-9be9-aa19f63de489","year":2021},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.558580Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:4fba89e40c2b32e04b4b17880e9859b96d603ce9bbd7e5538e4adfff80358307","observation_id":"51415097-2d8d-4f04-8d8d-4a1f768a04ff","resolution":{"observed_at":"2026-08-12T10:13:41.418841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.395300Z","title":"Digital image processing","venue":null,"work_id":"da171c86-8e8b-46a8-a510-13b8259cc800","year":2005},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.563720Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:ff9370853b546b588d092680e0ae2e11137f192af887df4a0636827d229c2519","observation_id":"0a7dcbed-faef-4f16-9566-14794036de09","resolution":{"observed_at":"2026-08-12T10:13:41.400503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.377987Z","title":"Motiongpt: Human motion as a foreign lan- guage","venue":null,"work_id":"0da786c0-f1f7-46fd-9b95-088090deab6a","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.569750Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:8c0a4e11d1bd43b9b02575b50fc6fd7b309d73b867398e45d1559c00af9447bf","observation_id":"1d25c30c-ac2e-487e-bd4d-fe96f12df98a","resolution":{"observed_at":"2026-08-12T10:13:41.383558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T10:13:40.574807Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.574807Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:b6ffe0053f6547e4be16f5618c12c1605ccb1013f6824012b6a337917ae6364a","observation_id":"c743c967-c44d-4ab0-bce1-0c26cd6deeee","resolution":{"observed_at":"2026-08-12T10:13:40.574807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06513","last_updated":"2024-10-09T03:27:14Z","snapshot_observed_at":"2026-08-12T22:27:39.628413Z","submitted_at":"2024-10-09T03:27:14Z","title":"MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06513","snapshot_observed_at":"2026-08-12T10:13:40.580329Z","title":"Motionrl: Align text-to-motion generation to human preferences with multi-reward reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.580329Z"},"links":{"cited_paper":"/paper/2410.06513","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0c9c9d13fbd359695a3595886bba2da96a9029395be79436272668ff43133127","observation_id":"635a1e0d-0bcc-49a2-9b29-6856134bbbd9","resolution":{"observed_at":"2026-08-12T10:13:40.580329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T10:13:40.586149Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.586149Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:a9094b52d0248e0332a4917f68d347445f64ced44ba665087c860e27e4c6e3d5","observation_id":"8b7b0fe3-09a8-45a0-9c7b-a6c04fa420c9","resolution":{"observed_at":"2026-08-12T10:13:40.586149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.591536Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.591536Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:14c5c4fc940f300d5396d4767b7e81fc4e6f623a1d6fdc7cd18069e327b15c6e","observation_id":"e3137eab-588e-410d-8fe4-22a636f1c0c6","resolution":{"observed_at":"2026-08-12T10:13:40.591536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T10:13:40.596628Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.596628Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:32e9b9d76c9de6ededf2d9ea576fb1a565bcda39fb9bf7e00168c39a6d3c6374","observation_id":"cbd17b83-ed0c-4bc5-ac1e-51f7ca7be329","resolution":{"observed_at":"2026-08-12T10:13:40.596628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.602806Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.602806Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:6ff2a635916341214fce0921c4c836c022fd3fbaa0866fad657b95d716cfdc60","observation_id":"df0364af-f184-47bd-abb4-bfb7d7eb7771","resolution":{"observed_at":"2026-08-12T10:13:40.602806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.337252Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"45ec83ca-77f5-4786-afbd-935e85cdf963","year":2021},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.608126Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:730fcde59dd7b2e43a8da612f44869d83911937254b65865359bef320ff4b055","observation_id":"610265d1-7e15-49f6-8f17-e962004d6f3b","resolution":{"observed_at":"2026-08-12T10:13:41.343599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.613159Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.613159Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:abbe4ca418f6ef611f7c32d09a2efd7b1d18435a83f2bf580a91c200769889f7","observation_id":"099f73fc-c123-481a-8729-e9b283e32030","resolution":{"observed_at":"2026-08-12T10:13:40.613159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.307787Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"0df7a756-6018-4a6f-9b12-02c7bd2cdcfe","year":2015},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.617674Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:9250c96e83c56f41f6c41217059c3149e302066399b52cba560e30d999128cee","observation_id":"8ee44a92-404d-40da-a3ef-885a4514d83e","resolution":{"observed_at":"2026-08-12T10:13:41.313799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T10:13:40.623959Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.623959Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:cb9e9dd605bd9cfdd9bfdd1d1e67c0836aa1193d94981dddaca7c963cd0dee30","observation_id":"b4956ba8-fa6f-4f93-9039-bbaa7eedde67","resolution":{"observed_at":"2026-08-12T10:13:40.623959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.290691Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"d4f25308-7052-4c0f-af7a-5b539fdd1719","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.629027Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:90f6c58379e9fe4c0373b9908aa49b66fa558cfccf8ba0902ba3ce1fdca1825b","observation_id":"8fe6dd56-9acd-417c-b744-5f76035aa2ef","resolution":{"observed_at":"2026-08-12T10:13:41.296313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.633810Z","title":"Human motion diffu- sion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.633810Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:40250b7a0649ed7443e8f3953bf6b1bef291279ce1074d826cdf0b1046870510","observation_id":"dfe17384-989e-4f99-aa52-2f582bd643e2","resolution":{"observed_at":"2026-08-12T10:13:40.633810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:13:40.638481Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.638481Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:25cc1316e2e4fb98abf4d1542a472dd79e2e3e078ba27464a8a1dc8964fb4b95","observation_id":"1eda211a-0435-4395-9a7b-9012e9d5a3e3","resolution":{"observed_at":"2026-08-12T10:13:40.638481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-12T10:13:40.643288Z","title":"Towards accurate generative models of video: A new metric & chal- lenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.643288Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:1d0bf320061f51b53cce77a29fe62844ff665a4df7633587c32ef825d6ea9ad8","observation_id":"7531c7ab-42c4-4264-bf72-4d052fa1e0d3","resolution":{"observed_at":"2026-08-12T10:13:40.643288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.262736Z","title":"Neural discrete representation learning","venue":null,"work_id":"bc96f02c-58f6-4231-ad0b-78a0f3126cb3","year":2017},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.648803Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:de42f2ed3065512cef79446846b90a6a01f40bf42b2906012b7feb6c05537ada","observation_id":"71ac6984-57c3-4c31-b2a3-7b57cb4c4fd6","resolution":{"observed_at":"2026-08-12T10:13:41.268363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.245937Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"4a258495-1072-4cfd-b9f7-ac7691a52be0","year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.653923Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:72e5787ce476de7d817f72ecdef285630c7a34bebff10a487764dac1587a55db","observation_id":"98037765-4d57-4783-b922-55550336bd89","resolution":{"observed_at":"2026-08-12T10:13:41.250983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-12T22:13:07.514751Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-12T10:13:40.659063Z","title":"Motiongpt-2: A general-purpose motion- language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.659063Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:2a45440a73b911cde84b41f94d2f017461b748a15309ce8f4d0b702c0c3ac17b","observation_id":"fd20ac5c-1ba7-43f4-a49e-379b1d094c9e","resolution":{"observed_at":"2026-08-12T10:13:40.659063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17438","last_updated":"2024-11-21T03:26:54Z","snapshot_observed_at":"2026-08-12T23:15:28.181869Z","submitted_at":"2024-07-24T17:15:58Z","title":"HumanVid: Demystifying Training Data for Camera-controllable Human Image Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17438","snapshot_observed_at":"2026-08-12T10:13:40.664845Z","title":"Humanvid: Demystifying training data for camera-controllable human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.664845Z"},"links":{"cited_paper":"/paper/2407.17438","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:32268b6930d838b438fd2702008a6fdd5d574e4ceef7880b203cb6a1f6eb4707","observation_id":"33df348a-e6a5-4dcb-b727-039626c45b6b","resolution":{"observed_at":"2026-08-12T10:13:40.664845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.670394Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.670394Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f588a30b99f5514e3504b7a52a42ed8586d1158809eb8d8ea1847a092d88bb56","observation_id":"8bb9181f-870d-4545-9828-2e672ae51df0","resolution":{"observed_at":"2026-08-12T10:13:40.670394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.676128Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.676128Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:7bb9ceb394b07bc5c3763d9ff3eab98525f422ea43baf29163719b0decc2bec2","observation_id":"f3572c70-a08b-4924-98ca-d62dd77bfcd8","resolution":{"observed_at":"2026-08-12T10:13:40.676128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.681243Z","title":"Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.681243Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:810306077d6015e22fa1e2be7bcb06c69ae4ecf131fda1dbca269257ec8511e1","observation_id":"b6f9a81c-d404-49f7-908b-0989387c194f","resolution":{"observed_at":"2026-08-12T10:13:40.681243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.686289Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.686289Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:74d3abb5ca78ef78c91a3c8953c02e55d93157dd66a54948fa02f2faba9b3a14","observation_id":"78dc247a-d061-4453-a51a-ca5796d4e07f","resolution":{"observed_at":"2026-08-12T10:13:40.686289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.183393Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":"c8bbc792-620e-47a3-a400-c60abc191f5b","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.691285Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:72228aef30748de08bf2849ed70859fd863ef82c1f0e3e697ed13105d04b9c4c","observation_id":"b6c0336b-a910-4c1b-b797-23bc570f50e2","resolution":{"observed_at":"2026-08-12T10:13:41.188838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-13T14:35:06.773752Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-12T10:13:40.696670Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.696670Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f5b38e7f5d8465d57025dc7a1646d9c3bfe35fc126a82ef019629bf2e0659688","observation_id":"fd0a3502-9bb2-4c97-b219-6ee916ee7cf3","resolution":{"observed_at":"2026-08-12T10:13:40.696670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.165836Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"e0d972af-ee76-4d6e-ab55-5668945fa8ed","year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.702359Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:1bae6dbafd41b39dae6b2bfd3e19b2f65429e7adebbf88d8f63c25f585668475","observation_id":"cbe6ab5c-e06a-4d22-a0da-2082230bd188","resolution":{"observed_at":"2026-08-12T10:13:41.171000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-12T10:13:40.708407Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.708407Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:b853834ccbfdbc12876d1125fb61873f103cedf79bf2882d478a306d83c4b5d0","observation_id":"e685905d-b4ac-4548-b98d-2af5ae8f7a7b","resolution":{"observed_at":"2026-08-12T10:13:40.708407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-13T04:40:24.036354Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-12T10:13:40.714663Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.714663Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:79ad6bc550c88c1f80e67fe719f1c7932d7d39d7b27d09a4c8401db67102fd4d","observation_id":"ac604c50-b044-487e-8a94-667f7703c171","resolution":{"observed_at":"2026-08-12T10:13:40.714663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-12T22:19:09.109938Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-12T10:13:40.720090Z","title":"Al- legro: Open the black box of commercial-level video gener- ation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.720090Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:c116d346332db5d03f3b248b58794c7312f35e16fca50cf13dd9ebf8adb1bdb8","observation_id":"751af8ba-2a72-4a5c-a9cb-cd6a7cb971b5","resolution":{"observed_at":"2026-08-12T10:13:40.720090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14781","last_updated":"2024-06-01T08:27:23Z","snapshot_observed_at":"2026-08-13T00:48:24.019003Z","submitted_at":"2024-03-21T18:52:58Z","title":"Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14781","snapshot_observed_at":"2026-08-12T10:13:40.725281Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.725281Z"},"links":{"cited_paper":"/paper/2403.14781","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:776e112beb7bf2527c9302251772dea74224ec553bda9e81e9ab34d8eed8fb4d","observation_id":"6a15dd41-6bbb-4c42-ad05-0eef4427a5b5","resolution":{"observed_at":"2026-08-12T10:13:40.725281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.149475Z","title":null,"venue":null,"work_id":"73393851-b5b2-4167-9d43-10f8ec0931ca","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.730645Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:19aa77083ab88b2716d3df98ff01864dfee122c5ac38c9670763814cd9bd3e5d","observation_id":"c12d70c2-b26d-4e82-b9e9-36160d1dd5c4","resolution":{"observed_at":"2026-08-12T10:13:41.154430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.132712Z","title":null,"venue":null,"work_id":"60bcf03d-462d-4936-8094-97f4e176efcd","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.736302Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:cf5337fba67f6adcf5613bcc922e374281736509c464ecd5900966c921aa35dd","observation_id":"059d3f59-9fa6-4b2b-8c68-2424071bec42","resolution":{"observed_at":"2026-08-12T10:13:41.137854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.114349Z","title":"Eight participants evaluate each video across three criteria: video quality, identity preservation, and motion-text alignment","venue":null,"work_id":"fa42328b-56ab-43fb-987d-1671e122343f","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.741528Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:a7fd1c9c36d2243ce0756485744c4b37817006c2a4c1f40ecc26b5bc1879d044","observation_id":"6570606a-56ba-4320-a462-a4119f302c96","resolution":{"observed_at":"2026-08-12T10:13:41.120246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.095414Z","title":null,"venue":null,"work_id":"a90fb3be-78a1-4ca0-baf4-83089deb1c46","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.746783Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:1cd132cd9010ad6d770feba269e05f65401b51e54fe0e62c12665c3046d49a35","observation_id":"d8e6b706-78f6-4a4c-b1fa-2c6eb3f5b2fd","resolution":{"observed_at":"2026-08-12T10:13:41.101458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2411.19459."}