{"as_of":"2026-08-07T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1d24c919cdc65af4060aeada9c67f1a9d912c4e7377409e9078121f832e0d95","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:25:01.610056Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:43:26.460480Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:47:57.362655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"cited_work":{"arxiv_id":"2506.14428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14428","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To- ward rich video human-motion2d generation","venue":null,"work_id":"16779690-cea2-487f-93f6-45f32e3d7ae3","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2506.14428","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:432c7cf9640a97a8fd72176201ef2d82c189aacc9d30b65eed1a253dca0ced75","observation_id":"1c072990-737e-4fc6-8106-75939e5a5725","resolution":{"observed_at":"2026-05-16T13:47:57.364645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14428/citation-record","integrity":"/paper/2506.14428/integrity","json":"/paper/2506.14428/citation-record.json","paper":"/paper/2506.14428"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.676664Z","title":null,"venue":null,"work_id":"a1dd1227-9873-4a0a-8299-1e5bc7ecef3b","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.340624Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:a3fb5820e2020fd65581eae59429823138b88a5be80bce694a110a151e2f0dce","observation_id":"b1fa6e78-1e28-4ce5-bd05-83ac88e33a0d","resolution":{"observed_at":"2026-08-07T00:25:02.681490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.662172Z","title":null,"venue":null,"work_id":"997d3ec7-c956-4d67-955c-961b22cc7337","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.347199Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:4ca238fbf987629395388e4355539e85bd2b9712b439d2edd6ac6cb0c5adb926","observation_id":"66625213-38fa-4305-93d0-1ac71bbfbf9b","resolution":{"observed_at":"2026-08-07T00:25:02.666456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.646627Z","title":null,"venue":null,"work_id":"784f3a48-e54a-41c1-abf7-8e9afd943f33","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.352186Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:bd4f316be7d1caf3578fa89dba8780cc71e63b99ee83b35623371bfb4f47df4e","observation_id":"d202fc12-6d67-4f1a-a92a-33d7e92ee966","resolution":{"observed_at":"2026-08-07T00:25:02.651340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.632276Z","title":null,"venue":null,"work_id":"d402e973-80d7-4a40-8db5-4646a20389f6","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.356934Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:60018700432157165dec2fed8166d2d70ba3f880111ae13b5ce681eb415049e0","observation_id":"d5e738fd-a45a-4496-b4ce-cb8b0f0ee7f4","resolution":{"observed_at":"2026-08-07T00:25:02.636887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.361327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.361327Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:0c551f9403352f66677a09d84dd880c0032c0a3c13dec4b10b9439120ff9c249","observation_id":"e680c9bb-5eb2-48bc-880b-8eaefcbfcddd","resolution":{"observed_at":"2026-08-07T00:25:01.361327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.617083Z","title":null,"venue":null,"work_id":"c1bfc559-e3a2-4c81-8914-af525560482a","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.366495Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:31efa162bb967c8a12121975af6a306dd39c5d25dc5bf3ab7192c4cbc9d87c35","observation_id":"9cce0bfa-0dd6-4040-9654-d3c725f7def8","resolution":{"observed_at":"2026-08-07T00:25:02.621811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.601008Z","title":null,"venue":null,"work_id":"f2628def-f2c0-4a78-8db2-5a151051e2c6","year":2021},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.372368Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:887c9c40df5235fb26d9b25f36cfdfe23dc57fdee7a87c24d6f40f0ad586931c","observation_id":"c14ae710-d13d-4535-9b1a-7847866421ac","resolution":{"observed_at":"2026-08-07T00:25:02.606721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04229","last_updated":"2024-02-06T18:36:52Z","snapshot_observed_at":"2026-08-07T03:55:52.770411Z","submitted_at":"2024-02-06T18:36:52Z","title":"MusicRL: Aligning Music Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04229","snapshot_observed_at":"2026-08-07T00:25:01.377107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.377107Z"},"links":{"cited_paper":"/paper/2402.04229","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:800a1166a22e43fff6361c06f8943e07fd344ee6aef478648ca6867e990a6713","observation_id":"6c0a886a-c7b4-4391-a553-9106330014db","resolution":{"observed_at":"2026-08-07T00:25:01.377107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.583836Z","title":"M.; Kim, N.; Bitton, Y.; Rieser, V.; Omidshafiei, S.; Hu, Y.; Chen, S.; Dutta, S.; Chang, M.; Lee, K.; et al","venue":null,"work_id":"01174d50-bb98-47ca-95d5-008ad6c1ce50","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.381834Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:28ee6ef42f53598d03492e06272c6b73b9c9be2c5c929512019a5b6eaea5cb73","observation_id":"dda5a97e-b364-43d3-a63c-44f4f52e78b2","resolution":{"observed_at":"2026-08-07T00:25:02.589662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.567950Z","title":null,"venue":null,"work_id":"436985f7-f644-4be4-aea3-727719554267","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.387184Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:635b049b2e5882414d19561b10f7e5b3861a5df389010a4cc00373c55f65c581","observation_id":"e579361d-6b86-46fb-a0a7-3543d005ac02","resolution":{"observed_at":"2026-08-07T00:25:02.573010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.550586Z","title":null,"venue":null,"work_id":"ab009abb-8e75-4ab8-bdff-0c9fe93d778d","year":2025},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.391729Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:c45605d406969b200d34d388ae47d9dbfdd53f44db4cba0a23c73acf86bd5024","observation_id":"94b81f96-c68a-4165-b776-3899195000ac","resolution":{"observed_at":"2026-08-07T00:25:02.556125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.534813Z","title":"B.; and Dynkin, E","venue":null,"work_id":"9e2c411d-0416-4325-bdfb-1727dcc97c85","year":1965},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.396181Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:e65f4e147d70f2b97fae8c2f7b0291ed7b8b2d44ce4bd4eb0fb1330ccb876918","observation_id":"f5f3e31e-2cf2-466b-a80c-4d553d86a31e","resolution":{"observed_at":"2026-08-07T00:25:02.540102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T00:25:01.400792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.400792Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:f1e0cb6775ccdbf418609120cd9af50a0fa58f6e17c47dacf32a6e21ba39b25f","observation_id":"9f8b6724-b80c-4015-9d2f-43daab83b888","resolution":{"observed_at":"2026-08-07T00:25:01.400792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-07-06T16:58:51.683654Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-08-07T00:25:01.405171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.405171Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:37af68cae0d3aeca35fe8fbdb7009cf8ec591bfb60360c1f313d9d9a6d41a877","observation_id":"a1d96c7d-546a-4316-aba7-3ef836fa1839","resolution":{"observed_at":"2026-08-07T00:25:01.405171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.519625Z","title":null,"venue":null,"work_id":"6236489f-2472-4a44-babb-ef436d1b86df","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.409872Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:047236358254b379b7bbd53a1cbc9cd4befaaed5f70fc7282059c88c79397fde","observation_id":"8e90afa7-c118-482a-8333-61865df2d0ed","resolution":{"observed_at":"2026-08-07T00:25:02.524396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.503646Z","title":"G.; Wang, S.; and Cheng, L","venue":null,"work_id":"0209a811-780b-4dec-a4f5-cced8b403c5c","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.415003Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:59b76c92ade1f173afcdb670b11a6db0bf01a7c0c1d6589639eed6e575b95732","observation_id":"120beaad-13e3-4795-bce7-f8dc8e6c8773","resolution":{"observed_at":"2026-08-07T00:25:02.509165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.487684Z","title":null,"venue":null,"work_id":"ad4fb0f1-33ed-41c3-9c54-43d6ed602a58","year":2022},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.420403Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:1ba7c4d95b4828cae201fa434fd7add8e1105d1e92e04ba167559e8e4cb60684","observation_id":"1ca89bde-4ae9-4976-b8c8-15daaad1356a","resolution":{"observed_at":"2026-08-07T00:25:02.493168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.425513Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.425513Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:fa1cc102b669d3fd4f9a427de46f51eca592622d572a8de2e7376fe6428eebc4","observation_id":"39c81b66-41da-4e70-ade8-c2ffc9da5d31","resolution":{"observed_at":"2026-08-07T00:25:01.425513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.429980Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.429980Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:be7e3ef38a64bc9cb08a74e038bc2dd62344989e1db71ec46f1ca89384b89dfa","observation_id":"8f2ae478-bc73-4b92-a447-6939e9e92ba6","resolution":{"observed_at":"2026-08-07T00:25:01.429980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.451631Z","title":null,"venue":null,"work_id":"3eed205d-5298-43a6-9a97-9f7e49f1238b","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.434426Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:3d220b1e2cf79496fd90c9daa539df2724d5165ccf5298a77d61d3c3b6d3e0ca","observation_id":"03b6e0ad-d94c-44a6-9fdf-1ae65e8e8749","resolution":{"observed_at":"2026-08-07T00:25:02.457012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07399","last_updated":"2023-07-03T03:06:26Z","snapshot_observed_at":"2026-08-03T06:41:22.144754Z","submitted_at":"2023-03-13T18:26:11Z","title":"RTMPose: Real-Time Multi-Person Pose Estimation based on MMPose","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07399","snapshot_observed_at":"2026-08-07T00:25:01.438694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.438694Z"},"links":{"cited_paper":"/paper/2303.07399","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:6027f384d476bed19b0d9ce3867091fe31b586ef6e0480c5847b0572a76193c2","observation_id":"bd57fa70-c60a-4d55-8c0f-ab7bd9e3e50c","resolution":{"observed_at":"2026-08-07T00:25:01.438694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.434432Z","title":null,"venue":null,"work_id":"66a1f753-2c56-456f-8b08-6561fbaca683","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.443474Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:3ced474d1f85162509b4d15aad45f6b8fb1746c052b8b2cf61f0328239b8321d","observation_id":"39c1702e-ac90-4b76-bbb1-322d46e54ba2","resolution":{"observed_at":"2026-08-07T00:25:02.439583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:25:01.448959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.448959Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:69ed26b8dba769475ea898bc0221db59ecd43a5f0224bbb4963b88515d720697","observation_id":"86fefc7d-1b5b-42fe-842e-6f71fd6165c8","resolution":{"observed_at":"2026-08-07T00:25:01.448959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.418706Z","title":null,"venue":null,"work_id":"f81f8cce-c8c6-402c-9570-798f9fbe9739","year":2025},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.453446Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:f4eb9e3fc7f28811de4b05bf43a30990d16548acf2d51f3d25ce6f7eec4550e9","observation_id":"62b01c50-3a58-4477-bd0d-7a0c839e4f67","resolution":{"observed_at":"2026-08-07T00:25:02.423768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-07-06T19:30:34.984716Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-08-07T00:25:01.458748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.458748Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:3f801725aae63d2df7178eb6fa3b4c8c7306f7ad1a8bed83dc7814ded5c9d3b4","observation_id":"c56ca675-7313-4a02-9da7-b3b9646e6179","resolution":{"observed_at":"2026-08-07T00:25:01.458748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.402908Z","title":null,"venue":null,"work_id":"200da53f-8645-4110-b9ab-7cf031137f92","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.467341Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:aa8e583e5b262ac94c185580310e497220867116248c2539d8cd595cafe4324c","observation_id":"1c7b35ef-b3de-43ba-8977-b53002d5fd36","resolution":{"observed_at":"2026-08-07T00:25:02.407956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.387174Z","title":null,"venue":null,"work_id":"06245663-a7ea-4be0-a55b-b91abefdf38f","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.472861Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:dd61ba4b17f8aa00d7970da2db32819df5173ac2af8834fbf98fd2cdfb9817c4","observation_id":"7c696fe8-ce20-4deb-9397-e70f67d2e834","resolution":{"observed_at":"2026-08-07T00:25:02.392242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.372302Z","title":null,"venue":null,"work_id":"753eee8d-555f-47c8-9bca-9c5f69696a6e","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.477486Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:64a1df8cb3e3eadf870ffe64842db80b56ed197fe9259dba9b048a52941a6ac0","observation_id":"745ca51d-a08e-4a6e-a83c-e6b964e0175b","resolution":{"observed_at":"2026-08-07T00:25:02.376746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.481920Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.481920Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:4f57a9cfad041789396ff18a3b63e0af6cfa267542c00ee1276f6c0f7cb4e81c","observation_id":"00b25b08-64b4-48cb-a125-fe0fe6f5e60c","resolution":{"observed_at":"2026-08-07T00:25:01.481920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T00:25:01.486586Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.486586Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:46ce21d231409719b22376ffae3e51d4ffbfc8c8c3338dc0da843ff723642403","observation_id":"c2d01728-fe1d-4ba4-ac19-421a77109587","resolution":{"observed_at":"2026-08-07T00:25:01.486586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.347522Z","title":null,"venue":null,"work_id":"09d3afd5-d98c-4dbe-9510-07d8f6469154","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.491531Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:d2c381c7f7a4b6ca7f3c212392448edf82faea75c3688126a32121f417f42a3c","observation_id":"f86e235f-57ff-44da-b500-05e3a12cd44d","resolution":{"observed_at":"2026-08-07T00:25:02.352401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01418","last_updated":"2023-08-30T04:41:10Z","snapshot_observed_at":"2026-08-04T22:38:03.106382Z","submitted_at":"2023-03-02T17:09:27Z","title":"Human Motion Diffusion as a Generative Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01418","snapshot_observed_at":"2026-08-07T00:25:01.496777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.496777Z"},"links":{"cited_paper":"/paper/2303.01418","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:72b0f04ff635479a1524362dcdacd7a25180030fa1ae4a56426d304483f933d7","observation_id":"5178868a-ad84-4fc2-9234-3675db78f886","resolution":{"observed_at":"2026-08-07T00:25:01.496777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T00:25:01.502196Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.502196Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:507a029a36be903259f73309c68c35b1cf054754274203a6bec23cb2ff7ef7e5","observation_id":"93d7f48f-1aea-4e56-932b-25e783e4461a","resolution":{"observed_at":"2026-08-07T00:25:01.502196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T00:25:01.507441Z","title":"R.; and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.507441Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:69b3df43a80da6545d8dc8fbbb9d5c9d0a3921c58d7ff0afc7a6ae3bd91436e9","observation_id":"15c37a45-7cbb-49c7-9286-5cc5527c74d3","resolution":{"observed_at":"2026-08-07T00:25:01.507441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.333016Z","title":null,"venue":null,"work_id":"3e853d7f-c273-4b58-a513-43e5a44b478c","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.512117Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:dbd3b92f64dba35b59742aef65601d7bd5ea0b2d625b21959dc7aa44bddb2377","observation_id":"852f6b0d-c422-4c2f-a95c-45d4ea88d3a9","resolution":{"observed_at":"2026-08-07T00:25:02.337663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-07T06:22:46.243818Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-07T00:25:01.516757Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.516757Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:27805abf41190a0d0d5937913ba78ca693c0e6a745794e1f8e81ac46cc0ebc2c","observation_id":"0b4a1f2e-cf15-4eca-b792-75ab695774c7","resolution":{"observed_at":"2026-08-07T00:25:01.516757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.316522Z","title":null,"venue":null,"work_id":"38cce4d4-c2c6-4fa9-9e01-12723b14168b","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.521624Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:a3e9c59e33fd49206fa535d296fcb7eec7412c33714a087bbf0ca240847a09bc","observation_id":"fe2b8730-3038-47c3-89ef-7d47f9f38268","resolution":{"observed_at":"2026-08-07T00:25:02.321880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.526354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.526354Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:92281540c45ad8c13e643b3573098aad10014d9385ddb0b4980ad94e19ab89bf","observation_id":"3bae2048-80eb-49b9-ba4f-fd8375c7c54f","resolution":{"observed_at":"2026-08-07T00:25:01.526354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T00:25:01.531091Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.531091Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:2369cc1870c96ee73a8f59859615e56b8198aaafb64082acb05454c4c027c6cd","observation_id":"8c9d50e8-a50c-488e-bc84-3cfdd83b0ba7","resolution":{"observed_at":"2026-08-07T00:25:01.531091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24026","last_updated":"2025-04-01T03:43:35Z","snapshot_observed_at":"2026-08-04T04:31:20.417958Z","submitted_at":"2025-03-31T12:51:45Z","title":"HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24026","snapshot_observed_at":"2026-08-07T00:25:01.536147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.536147Z"},"links":{"cited_paper":"/paper/2503.24026","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:25470632acb7432d7b51a33fcaddfec34302ba0e7bf77ec9c5229719266506f8","observation_id":"83654fe1-d8b8-40f0-9f8d-793bd2dcb8eb","resolution":{"observed_at":"2026-08-07T00:25:01.536147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19487","last_updated":"2024-07-28T12:47:20Z","snapshot_observed_at":"2026-07-06T18:52:56.476112Z","submitted_at":"2024-07-28T12:47:20Z","title":"RLCoder: Reinforcement Learning for Repository-Level Code Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19487","snapshot_observed_at":"2026-08-07T00:25:01.540784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.540784Z"},"links":{"cited_paper":"/paper/2407.19487","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:7d7da1adb353901f1c239703c280034d4a1e08503b63f18ed4aa5e3023a06508","observation_id":"a8815710-38c6-4888-809a-d5c87a1c20b1","resolution":{"observed_at":"2026-08-07T00:25:01.540784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11253","last_updated":"2024-06-17T06:31:19Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T06:31:19Z","title":"Holistic-Motion2D: Scalable Whole-body Human Motion Generation in 2D Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11253","snapshot_observed_at":"2026-08-07T00:25:01.546743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.546743Z"},"links":{"cited_paper":"/paper/2406.11253","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:8b0d6c40a6910236675746b2174fc02386d7bb25d0dc79cc18307609af9ab55b","observation_id":"c069c9b6-9bd8-4837-8bdf-24cf19cc6642","resolution":{"observed_at":"2026-08-07T00:25:01.546743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.551569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.551569Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:b4f0b91ffe57432109dbde2f4ddd9ce955b058c5523530bbf853e4b1ec464726","observation_id":"3c9ed1ce-a201-4384-9e8e-c7e8ff06af00","resolution":{"observed_at":"2026-08-07T00:25:01.551569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.291505Z","title":null,"venue":null,"work_id":"fc829f5a-28cb-43a2-889b-2957a4444294","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.556280Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:18e23f24e1d19509b01ac5758174074c7159b49f9ed43b4b023bfb79d89929e7","observation_id":"140d7e64-81b0-4ebc-b9a6-9c6e1df8d8ef","resolution":{"observed_at":"2026-08-07T00:25:02.296275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T00:25:01.561578Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.561578Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:08a8d73846f9a64999c72e9163537ca4ef2469d87133b22de60741aff970cfdb","observation_id":"559a4317-2615-4f68-9f49-785dc8100937","resolution":{"observed_at":"2026-08-07T00:25:01.561578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.276394Z","title":"H.; and Son, J","venue":null,"work_id":"7fe2dcbc-72ca-4d57-8e83-513a839e0ff8","year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.566366Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:278126545cde543d872f81fd59e096518b1e078cd156d71bc18a8bcb7cbddf96","observation_id":"c90fa2dd-75a7-4c5f-8cfa-3bcb382c9da3","resolution":{"observed_at":"2026-08-07T00:25:02.281309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.259960Z","title":null,"venue":null,"work_id":"14dcd0bb-da0f-4bd0-8b04-167c57ea857f","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.570922Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:265985e3ec3ce581c2bbe75f99a0ae3107c6ad6fd1c28e791052f3420015ebe5","observation_id":"fe3de243-e20c-440e-98e9-992424239bd1","resolution":{"observed_at":"2026-08-07T00:25:02.265834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-03T20:36:12.167885Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-07T00:25:01.575534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.575534Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:54c5358a0dad5c9da851c17705bbb50c541595a60bf688f31b26c66135b0f038","observation_id":"2f6993f3-31c1-4a6f-9489-297b31250945","resolution":{"observed_at":"2026-08-07T00:25:01.575534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:01.580117Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.580117Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:8f301087f25932b0ec9e56c7c95f2d4fc3dea2e2c9747d527de52cb3b2e8f8a0","observation_id":"16caaeff-9467-4baa-873c-974f5367dbd3","resolution":{"observed_at":"2026-08-07T00:25:01.580117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.233557Z","title":null,"venue":null,"work_id":"a8139656-7e3e-4fbe-a921-df13e889c906","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.584887Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:f47ba9eaf24149614bbe418e92aeac2dd54547d8c8f23e82b5b3d1aaf5278d75","observation_id":"d51b24a0-7c23-40b0-94b6-73499bca4236","resolution":{"observed_at":"2026-08-07T00:25:02.238423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.217943Z","title":null,"venue":null,"work_id":"bbda3ee5-e96a-4963-9c62-cfa01051e812","year":2013},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.589926Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:5e26ffad61ac85b6099547b809511acbb68d63d4034d8e484db1a6e3dece8657","observation_id":"2c2c5ac3-d075-4c05-add6-9443510958d7","resolution":{"observed_at":"2026-08-07T00:25:02.222700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T00:25:01.594512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.594512Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:7ce8c5fa27b1077b4d9476fc7f792fd1c365ae192a8acdaeea00d55ceeadc7b4","observation_id":"7aa55de9-73bf-42b8-8d7b-14121f0f7bfc","resolution":{"observed_at":"2026-08-07T00:25:01.594512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.202077Z","title":null,"venue":null,"work_id":"1f5c7273-af53-4e98-bd67-035d0cdd8c88","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.600327Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:e35405a826d74feca54734b781b6a8af6fc0c0d8b113a1c9fac337f357991e41","observation_id":"4dac1751-4547-4bba-93b0-01ae12fcab78","resolution":{"observed_at":"2026-08-07T00:25:02.206824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.185498Z","title":null,"venue":null,"work_id":"a8bdaac7-de4d-4eae-9694-943d8b74119e","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.605326Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:b2e3c597a9c68427a2c15389d7911a6bbe4dc7fb1b0a3d258f62382a31c2cd9b","observation_id":"940a3309-972a-46cc-a399-0c5d56d9471a","resolution":{"observed_at":"2026-08-07T00:25:02.190696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:02.168246Z","title":null,"venue":null,"work_id":"78cf03ad-6bbe-471a-bfa8-2ea74d074e9d","year":2024},"citing_paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:25:01.610056Z"},"links":{"citing_paper":"/paper/2506.14428"},"observation_digest":"sha256:2ccf692b982d5d9c3358a861edf15f7b49647d7365d0fabfbcfc0c364c058fef","observation_id":"56800785-fb19-4723-884d-7f9d393cd345","resolution":{"observed_at":"2026-08-07T00:25:02.174152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14428","last_updated":"2025-06-17T11:45:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:15:32.812600Z","submitted_at":"2025-06-17T11:45:33Z","title":"Toward Rich Video Human-Motion2D Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2506.14428."}