{"as_of":"2026-08-13T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ec7719e0c31a441d7c61497e4d63549c4d0ca447de9ee30f11bea7ea8ec8045","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:25:12.007539Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.16670/citation-record","integrity":"/paper/2412.16670/integrity","json":"/paper/2412.16670/citation-record.json","paper":"/paper/2412.16670"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.554722Z","title":"Intergen: Diffusion- based multi-human motion generation under complex interactions,","venue":null,"work_id":"8c667706-c202-47b7-83d7-380b03ab8cce","year":2024},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.848489Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:f9faf86cce4748939d9927ad894d6ea61b8d2dfa25519edd86754e8634e480e1","observation_id":"7444b077-e86b-4276-928e-400d95366ffa","resolution":{"observed_at":"2026-08-11T10:25:12.559409Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-08-12T18:48:37.916493Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-11T10:25:11.852848Z","title":"Human motion diffusion model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.852848Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:e46fc75529258720f5dacbf9debd8d7d4a100c506fbf8d295d01400daabd5f4d","observation_id":"3693ec4b-11ba-45de-b80a-904f4f00cf16","resolution":{"observed_at":"2026-08-11T10:25:11.852848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01418","last_updated":"2023-08-30T04:41:10Z","snapshot_observed_at":"2026-08-04T22:38:03.106382Z","submitted_at":"2023-03-02T17:09:27Z","title":"Human Motion Diffusion as a Generative Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01418","snapshot_observed_at":"2026-08-11T10:25:11.857466Z","title":"Human motion diffusion as a generative prior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.857466Z"},"links":{"cited_paper":"/paper/2303.01418","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:9c56c0c5bfad9da451aba68d8a112f5cc899250d88eafac14e9ea54149919f56","observation_id":"c44c3f4f-32f8-493f-ac04-a533f90a14ce","resolution":{"observed_at":"2026-08-11T10:25:11.857466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15864","last_updated":"2024-11-21T03:51:58Z","snapshot_observed_at":"2026-08-13T05:17:00.942753Z","submitted_at":"2023-11-27T14:32:33Z","title":"InterControl: Zero-shot Human Interaction Generation by Controlling Every Joint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15864","snapshot_observed_at":"2026-08-11T10:25:11.861738Z","title":"Intercontrol: Generate hu- man motion interactions by controlling every joint,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.861738Z"},"links":{"cited_paper":"/paper/2311.15864","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:0c1181d3e67daa52711ad701b226bfa12bd03f3f90e1e119b234674be6d59da4","observation_id":"fb410ce8-24d1-4451-b9c7-0f67b68054f1","resolution":{"observed_at":"2026-08-11T10:25:11.861738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.866276Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.866276Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:a25761a1903e20b4f06b1d3fd5961dc0e1eb878b37520fbf9a719dc6cce31b7e","observation_id":"5af25614-ce10-43fa-a177-0aeeb0431e03","resolution":{"observed_at":"2026-08-11T10:25:11.866276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.870000Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.870000Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:afc5b3d7b04a0346a2f556b7735252f4d723a3e78aada2653c170225b0b14ba0","observation_id":"5db837ab-b43f-4c4d-9e2c-0a4562986c98","resolution":{"observed_at":"2026-08-11T10:25:11.870000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-09T16:31:06.714132Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-11T10:25:11.874007Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.874007Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:18ee808a09a476aa2c1ffecb1fdcea8c78c7ee2f9c7e475c4947df85a117f9e9","observation_id":"9d4268f9-c684-4d43-a99a-a06a9f7a2f88","resolution":{"observed_at":"2026-08-11T10:25:11.874007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.877812Z","title":"Physdiff: Physics- guided human motion diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.877812Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:e4e54a2229586920628b18198609e456bd38135dd7c4d2c90a230d395bc89b87","observation_id":"025d326c-06e8-4400-ad97-3f8eab1e3a38","resolution":{"observed_at":"2026-08-11T10:25:11.877812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02256","last_updated":"2024-11-23T16:09:58Z","snapshot_observed_at":"2026-08-13T05:10:08.739049Z","submitted_at":"2023-12-04T18:58:38Z","title":"EMDM: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02256","snapshot_observed_at":"2026-08-11T10:25:11.881358Z","title":"Emdm: Efficient motion diffusion model for fast, high-quality motion generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.881358Z"},"links":{"cited_paper":"/paper/2312.02256","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:01662e477369f4e32a489dccc5bf987cad83d88bbcc59d58a5d63b8219755056","observation_id":"8c7c945c-b807-4a4c-b43e-8f3c1ef14981","resolution":{"observed_at":"2026-08-11T10:25:11.881358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.885149Z","title":"Listen, denoise, action! audio-driven motion synthesis with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.885149Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:1de842e098f3682ba128485a26189871be9939ec277a208a9fa71c333af4ce8d","observation_id":"f7cbc58e-1bb3-44df-905a-3ca72efd5c65","resolution":{"observed_at":"2026-08-11T10:25:11.885149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.888433Z","title":"Executing your commands via motion diffusion in latent space,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.888433Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:7370e46cd932deecbf92b960347fdcdfb056896a6e341de07e0d5f2c3ef3be4e","observation_id":"a75fb548-c9a9-4a61-82a4-90f1ebac1169","resolution":{"observed_at":"2026-08-11T10:25:11.888433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.891702Z","title":"Action2motion: Conditioned generation of 3d human motions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.891702Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:2ed45cc9614c4ccbbe625856f5486303504114116553001cae4c98a80f2056fd","observation_id":"c34a814d-3a6a-4921-a00d-ce259b17d422","resolution":{"observed_at":"2026-08-11T10:25:11.891702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.492966Z","title":"Action-conditioned 3d human motion synthesis with transformer vae,","venue":null,"work_id":"8899d7e5-d2e8-4e57-a6aa-79dcdd2a3001","year":2021},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.895402Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:40d8036bad0a882a423216cd2e47c25edc1c1a8ab0bdb9056b4b2490a36757b1","observation_id":"cc8a5b91-77a8-41ea-abf0-26ec6d3bae1c","resolution":{"observed_at":"2026-08-11T10:25:12.497181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.480183Z","title":"Text2action: Generative adversarial synthesis from language to action,","venue":null,"work_id":"91a015cd-541b-4836-9817-8dcee875c06c","year":2018},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.899044Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:23d6b73ff431092ed06751cd21f9c8a87574143916593980bb07fb35187513fd","observation_id":"6e2de7b4-4203-4f79-9c1b-d5a801437e9e","resolution":{"observed_at":"2026-08-11T10:25:12.484755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.902684Z","title":"Temos: Generating diverse human motions from textual descriptions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.902684Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:fcb47026dbb36b0c89a30d4d85f6f8622c4875bc6899b3527234657b5a13ab45","observation_id":"cadebe3f-9a4d-40f0-86ae-c0b8fc77b018","resolution":{"observed_at":"2026-08-11T10:25:11.902684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.457615Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal generation of 3d human motions and texts,","venue":null,"work_id":"5210b759-fd8e-40eb-9793-fafa3251b339","year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.906245Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:f2978e22ef22b650873ade2dfc6ecc78584ae7d794b6dace998e79409ee6cdd4","observation_id":"682ccf81-7405-4b82-9f5b-b3f8536aff11","resolution":{"observed_at":"2026-08-11T10:25:12.462006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.445236Z","title":"Generating human motion from textual descriptions with discrete representations,","venue":null,"work_id":"f7445f11-7576-455a-8f4b-9b042333289b","year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.909546Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:d43f664297d04a42b21aff18d5b567089b05e728516b8e077eeb1620f2042648","observation_id":"9123dc25-d1b8-41e2-b080-c28b478d50ee","resolution":{"observed_at":"2026-08-11T10:25:12.449802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.912827Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.912827Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:d03e3f71c436b5b31e551099ac7cf4422c23cedf1462fa2ffba27cbdb24fb23d","observation_id":"335d012d-21f5-47a5-a95e-847204ee9ea0","resolution":{"observed_at":"2026-08-11T10:25:11.912827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.916233Z","title":"Generating diverse and natural 3d human motions from text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.916233Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:9c7a9c283e162990eda81f071c94f68a650bf8a6572003f2d215b18c36e6b14a","observation_id":"86433db1-06a4-4235-b5ef-284c2844f484","resolution":{"observed_at":"2026-08-11T10:25:11.916233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.919541Z","title":"Bailando: 3d dance generation by actor-critic gpt with choreographic memory,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.919541Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:e3bffd5983957e4b5ea4aac5e71a22554111737e2bda1880313181bd64148390","observation_id":"a80cf2ef-2e1d-470a-bee2-d1553616ebb3","resolution":{"observed_at":"2026-08-11T10:25:11.919541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.407823Z","title":"Audio2gestures: Generating diverse gestures from speech audio with conditional variational autoencoders,","venue":null,"work_id":"9c1fbb08-8668-449c-a28d-7e8316353b6d","year":2021},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.923017Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:e836e33a38703a31e4f7637a388c6682efc640b5eedbb44dffbd632c942c27aa","observation_id":"de855df7-e235-4067-9396-ad2109b42c08","resolution":{"observed_at":"2026-08-11T10:25:12.412322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.394582Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis,","venue":null,"work_id":"ac788177-a845-4d32-a158-f5337ceee8d5","year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.926397Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:92fbc2555ea931c745ceb22fd0a6babacc10d335822a236c7c407ea22fe1b658","observation_id":"dadd2525-32e2-4200-8ef3-1bc729381d4a","resolution":{"observed_at":"2026-08-11T10:25:12.399088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.381276Z","title":"Action-conditioned on-demand motion generation,","venue":null,"work_id":"443e9186-7d76-43d2-a9b2-40c728d8298b","year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.929558Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:c660b0c40f70513be4d150693399dd95ccc2a63be79f9284c970dfd12919f218","observation_id":"482fbddf-4e39-499a-9043-8e81872926e3","resolution":{"observed_at":"2026-08-11T10:25:12.385436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.368324Z","title":"Posegpt: Quantization-based 3d human motion generation and forecasting,","venue":null,"work_id":"2ddfa692-77df-4279-a7ef-d56a2a848e2f","year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.932947Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:5454f9dfbbce8f974592b15fcf919eaa87b281f7af45aaea100b2bd462d254ca","observation_id":"bf7ae7ec-7004-4173-99e2-185a3c6f55c3","resolution":{"observed_at":"2026-08-11T10:25:12.372382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.353765Z","title":"Motionclip: Exposing human motion generation to clip space,","venue":null,"work_id":"ce6cbed7-76e6-4436-8f2c-e01730bb9b90","year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.936385Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:ca4f86d918320ab0f4132032a9855c6a72368cd4ed801152ea3b655bacb0c84c","observation_id":"c8f7ab19-b8ea-4179-a806-33d75b30468a","resolution":{"observed_at":"2026-08-11T10:25:12.358482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.341677Z","title":"Humantomato: Text-aligned whole-body motion generation,","venue":null,"work_id":"0604ab55-cc5b-4f7b-af3f-75adb46833a2","year":null},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.940031Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:a309aadedea859f3188f4e0265e725e768def0c135ed048cbcc3252730915e73","observation_id":"58a57b73-b239-4c57-a687-94ccb8eda6d6","resolution":{"observed_at":"2026-08-11T10:25:12.345707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08580","last_updated":"2024-04-14T22:23:18Z","snapshot_observed_at":"2026-08-13T05:50:22.925969Z","submitted_at":"2023-10-12T17:59:38Z","title":"OmniControl: Control Any Joint at Any Time for Human Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08580","snapshot_observed_at":"2026-08-11T10:25:11.948161Z","title":"Omnicontrol: Control any joint at any time for human motion generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.948161Z"},"links":{"cited_paper":"/paper/2310.08580","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:49aaca39f5e05bcc3a91a6fcbcbe26d73eaef666d2d3352eacde2171ab5b0341","observation_id":"389f906d-334a-4fac-a47b-d2d245da0a66","resolution":{"observed_at":"2026-08-11T10:25:11.948161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.952144Z","title":"Text2motion: from natural language instructions to feasible plans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.952144Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:1fe38549f5f8cd4691337fe13c6bef8ec95fd3c70a5dd28e5b4bb544b3c9226f","observation_id":"cc6d8a34-f16f-4475-b2e0-fd04fd7f38f4","resolution":{"observed_at":"2026-08-11T10:25:11.952144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-11T10:25:11.955770Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.955770Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:bc46b7d2764188743851fb6315af92a63b575232f4fa27e299fa2d278075e570","observation_id":"1cceec5f-a770-4cc6-a217-37323563d0b6","resolution":{"observed_at":"2026-08-11T10:25:11.955770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T10:25:11.959469Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.959469Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:1ba07ad90e30ed318f9e2ddd8740efe1e8644b03048dface65d0be1c4827ba13","observation_id":"6e20a69d-97ec-4c81-be27-f1e023b3b9e0","resolution":{"observed_at":"2026-08-11T10:25:11.959469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:12.329213Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"ac37f9ab-59a2-4042-b045-0a34c231324f","year":null},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.962987Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:7919bc1fd75e6f9b06e6891e08f95a5f0a0791d3da8c7d340a48d09aab257cc8","observation_id":"c71ce27d-81d5-4e1a-9e38-4cf6a5d1d734","resolution":{"observed_at":"2026-08-11T10:25:12.333320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:25:11.970364Z","title":"6d rotation representation for unconstrained head pose estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.970364Z"},"links":{"citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:78ab79ff9f540260e7301718ddf7bea1cec8620971885dfeb779084cc60799b7","observation_id":"7342d3c9-df8d-4624-b117-06bd8783aaa1","resolution":{"observed_at":"2026-08-11T10:25:11.970364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-11T10:25:11.966449Z","title":"Available: https://arxiv.org/abs/2212.09748","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.966449Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:cc23ae744ff7f73af0902f393d0f6ff7c6337d051bd0b1bde8db60e67f5c6fbc","observation_id":"95ba7443-7ed2-481e-8cf1-99f85ce064f0","resolution":{"observed_at":"2026-08-11T10:25:11.966449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T10:25:11.977726Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.977726Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:9e0db2c0a8f03b24254f05f47ff868b5ca76afa80ce885d48c5143200ea4362a","observation_id":"63548cd1-a47d-473e-bd4d-464adc45e615","resolution":{"observed_at":"2026-08-11T10:25:11.977726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-13T05:49:42.133862Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-11T10:25:11.973867Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.973867Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:f5e5690c5b1159a3a5e7a2c1f2a8e7e5ed4f4df5499a4d0c01742a1e70857822","observation_id":"71340758-b045-4e7a-8f6e-d8265f691c79","resolution":{"observed_at":"2026-08-11T10:25:11.973867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15763","last_updated":"2024-05-24T17:57:57Z","snapshot_observed_at":"2026-08-12T23:58:33.583062Z","submitted_at":"2024-05-24T17:57:57Z","title":"FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis","version":1},"cited_work":{"arxiv_id":"2405.15763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15763","snapshot_observed_at":"2026-08-11T10:25:12.108653Z","title":"FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis","venue":"cs.CV","work_id":"914ff31d-3389-4ce8-83ac-62a2c36b987d","year":2024},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.984951Z"},"links":{"cited_paper":"/paper/2405.15763","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:f7d7b873ce3307da10b7c76719e2f8c7cd6eb1b47b142bc3fdfe1e37b5b577aa","observation_id":"d4a25710-ccf9-406f-8fa1-4591d33f93d5","resolution":{"observed_at":"2026-08-11T10:25:12.114864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T10:25:11.981591Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.981591Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:74192a65c7b9f0cf75db21b47240f7871c3d6106bd0d2040aab05ac0c1e59386","observation_id":"8c3c4d8d-862e-4e61-b4d6-23e70b5dc0ac","resolution":{"observed_at":"2026-08-11T10:25:11.981591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.05770","last_updated":"2016-06-14T09:01:36Z","snapshot_observed_at":"2026-08-08T21:24:12.859869Z","submitted_at":"2015-05-21T15:36:37Z","title":"Variational Inference with Normalizing Flows","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.05770","snapshot_observed_at":"2026-08-11T10:25:11.992322Z","title":"Variational inference with normalizing flows,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.992322Z"},"links":{"cited_paper":"/paper/1505.05770","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:e6da8cf7d6445415a8e05b47bf6cd2be2058fba82d2ba4b9c08b3be9b401363c","observation_id":"bcea29d0-ed32-400d-a8a7-02abdf3b55fb","resolution":{"observed_at":"2026-08-11T10:25:11.992322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2661","last_updated":"2014-06-10T18:58:17Z","snapshot_observed_at":"2026-07-06T03:46:00.791740Z","submitted_at":"2014-06-10T18:58:17Z","title":"Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2661","snapshot_observed_at":"2026-08-11T10:25:11.988609Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.988609Z"},"links":{"cited_paper":"/paper/1406.2661","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:56c588f35cf2e1b0f45e481095eabd1db6c0d7302412b9a864d5015275e72264","observation_id":"beaff983-1896-442d-869c-18d18871ed4e","resolution":{"observed_at":"2026-08-11T10:25:11.988609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T10:25:11.999645Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.999645Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:aa720923fce5bc75f76502507be767a8dbdf04ed3ba05f3020c27ecf88b7aa1c","observation_id":"2646fd8c-41b8-4917-ac5f-2ee46118945d","resolution":{"observed_at":"2026-08-11T10:25:11.999645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-11T10:25:11.995916Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.995916Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:78d1f9e48adb081c6f4d4cefb8bfce79384d517d2c2e60ad173f1f0d4e84eacd","observation_id":"29411e38-d2d7-4fef-bae1-fd485c00a744","resolution":{"observed_at":"2026-08-11T10:25:11.995916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-11T10:25:12.007539Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:12.007539Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:c681bf7a0d8adc97ee3e11919196e1e749497526aae52053b7b6119632bf0a99","observation_id":"2f4478d2-521b-4806-9650-d9bcb9894243","resolution":{"observed_at":"2026-08-11T10:25:12.007539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-11T10:25:12.003741Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:12.003741Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:22bb87e3049c46d1474475ba247438fa1948e979acd1e496a8220e1d564bd924","observation_id":"fecf5dec-34e7-480f-9f4d-25eada18ea4c","resolution":{"observed_at":"2026-08-11T10:25:12.003741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-13T05:45:08.905591Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-11T10:25:11.943916Z","title":"Available: https://arxiv.org/abs/2310.12978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T10:25:11.943916Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2412.16670"},"observation_digest":"sha256:ca777c3e037b0e60244da217be6110e20d4efd3c8f202eb2a2e3dd0b25ce7520","observation_id":"49783e9f-c7bc-47b8-b84b-1d75bc646090","resolution":{"observed_at":"2026-08-11T10:25:11.943916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16670","last_updated":"2024-12-21T15:35:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T05:42:11.195090Z","submitted_at":"2024-12-21T15:35:50Z","title":"Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2412.16670."}