{"as_of":"2026-08-07T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33da76ea73bcdfa08ffa62e0bda8f0a48da83c2860819c3706fa0b618f2b7114","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:16:25.195091Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00299/citation-record","integrity":"/paper/2508.00299/integrity","json":"/paper/2508.00299/citation-record.json","paper":"/paper/2508.00299"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.178268Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"5d3d5cdc-3e41-4e06-a64d-d430a74197fa","year":2020},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.899974Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:9c7ca70aa864311f10850cd3a35b4b7544710a35296eb4b71628985fb2502f2f","observation_id":"f1709da7-3301-4bd1-9047-90e206426fb2","resolution":{"observed_at":"2026-08-06T10:16:26.185487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.158931Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"9cf5fd61-d53c-4396-af65-44d1a16ffa72","year":2017},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.906469Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:df8e45c8e6d490bc9eb2450fc57babcc2603ba62fc1babb1dc90eb3b6611687a","observation_id":"344670a6-f5c9-433e-b2d2-1274f5d0436c","resolution":{"observed_at":"2026-08-06T10:16:26.164549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-06T10:16:24.912356Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.912356Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:0b793556dfbbb488247a6efd256dcd314ac0704af4836ec9283b636a1131ed3d","observation_id":"2d753344-c695-471f-a7e5-00e479dbfade","resolution":{"observed_at":"2026-08-06T10:16:24.912356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.130717Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"7d7588f2-ad43-4d34-9e27-74fe88c12962","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.919206Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:dac13259ffda3a0e0f2720b9c67342e72e9e4781bc77842dab4db4c7fc9a2161","observation_id":"3b5b99bc-8835-4833-955b-e8aa173fa971","resolution":{"observed_at":"2026-08-06T10:16:26.137906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14475","last_updated":"2025-07-25T02:48:16Z","snapshot_observed_at":"2026-07-06T18:18:34.617427Z","submitted_at":"2024-05-23T12:04:51Z","title":"MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14475","snapshot_observed_at":"2026-08-06T10:16:24.928194Z","title":"Magicdrive3d: Controllable 3d genera- tion for any-view rendering in street scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.928194Z"},"links":{"cited_paper":"/paper/2405.14475","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1d23620ce04a4dfa46526436c6a0a8626c5700c1c84c6b466c4856d88715a642","observation_id":"e04cbcc0-5027-43ca-b8dc-f6f4fa088e25","resolution":{"observed_at":"2026-08-06T10:16:24.928194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-07T02:31:28.236732Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-06T10:16:24.935021Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.935021Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:3af78bab81f65dbae62bf58a8134da5d6404d1dd99cb6a32779c125eb2d72f63","observation_id":"a0b0984a-ad08-4229-97c8-ea0ac9aa733f","resolution":{"observed_at":"2026-08-06T10:16:24.935021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.101675Z","title":"8 Densepose: Dense human pose estimation in the wild","venue":null,"work_id":"850afea3-84f0-4de8-a48e-a72863a99027","year":2018},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.945679Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:b5d4506d351dcdde64a2ba2aa7b00878145a2e61068d438ee93b9a3870d62eb5","observation_id":"646d4b11-bdc7-44b7-92ab-4b3199161c35","resolution":{"observed_at":"2026-08-06T10:16:26.109398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T10:16:24.951761Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.951761Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:a2ec82fcd1102250caf08e8b9334b1c45c909b45a52a552c97ce9d9302883ace","observation_id":"9c1c7d5b-4774-4b90-9fd9-d732087ce681","resolution":{"observed_at":"2026-08-06T10:16:24.951761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.077489Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"999e15c5-f1b0-442e-9e58-e85492443895","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.961062Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1466951e19d2b7fc7e67f10d7821b6c614fd5fde57e7a29c36df18594c45a74d","observation_id":"2c446e23-4e59-48f8-9921-2e145ef193f8","resolution":{"observed_at":"2026-08-06T10:16:26.086274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.050407Z","title":"Composer: creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":"2e4ee8d0-c9b7-4f89-8eb6-aacbed64cd1b","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.967038Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:683785d2195f9f17247e6f12e0400906720156f36e90c54e4d32280cc153c3de","observation_id":"0c54ec4b-1903-412c-a5c1-c33ef59082f3","resolution":{"observed_at":"2026-08-06T10:16:26.061135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.017148Z","title":"Text2performer: Text- driven human video generation","venue":null,"work_id":"7596f143-3e22-419f-b6c1-a792f5592036","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.973620Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:846a6e2156dff25a2ee1ffff13d4271d66a56ac153049c032140c7276e828c79","observation_id":"7f3ebcc3-659e-4b6d-8079-f3139bf4e40c","resolution":{"observed_at":"2026-08-06T10:16:26.026724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.992027Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"6240b754-af3d-4afc-a40b-083bea0489b2","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.980160Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:84a0b053483cccccb675d1a06c0abc8b1b07e5ce004f67495d0408f47e92a042","observation_id":"c05a73ef-79e9-4afe-b590-977e1d27adf9","resolution":{"observed_at":"2026-08-06T10:16:26.000347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:24.985880Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.985880Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:dfa6685b2a7a1c8ec8a33e34316b327272dd98b4bb5c9e2b0394fe785c86d1b9","observation_id":"d265aa3a-7c9f-443e-bc05-d5566f713e7d","resolution":{"observed_at":"2026-08-06T10:16:24.985880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.954679Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"136a4438-5997-4a35-bc41-d78d32c67e30","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.996857Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:d559acc895a19966f34cee3b816015e1edd2f30673445f48a1fcce0021129763","observation_id":"c68de3f0-fb6f-45ef-a711-eccf83756222","resolution":{"observed_at":"2026-08-06T10:16:25.962621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T10:16:25.003240Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.003240Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:875894f749f4939c47f21694436ac8872d7e1400494ff13b6c372af74da16990","observation_id":"c43b8eca-1d7c-4971-9c64-66c158d3560c","resolution":{"observed_at":"2026-08-06T10:16:25.003240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.932212Z","title":"Smpl: a skinned multi- person linear model","venue":null,"work_id":"ee6ad110-30be-4bc0-8cdb-1c0ca9bc727f","year":2015},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.009837Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:894b0ba686f3ba91406e5f7a40f5631c587e0f8407a7fe7cfdcef72303a3c5f9","observation_id":"15f9c03f-ab2a-4c2c-ae1d-1ac1c14c2c01","resolution":{"observed_at":"2026-08-06T10:16:25.939959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.015386Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.015386Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:45f9ef6d20ec9080ea0b3c76475b96c3ef34985be4cf85fae8cf5fb18b282b23","observation_id":"4a51c89b-3c3c-4abe-912a-984fc405fb81","resolution":{"observed_at":"2026-08-06T10:16:25.015386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.021308Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.021308Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:fa12601a8f359eb5e0602068e7bd61d2e3e49f5892a221d44ab6edeccf2e06a9","observation_id":"9f3c09a6-a6c0-4a6b-800d-c5d6c0ec6e26","resolution":{"observed_at":"2026-08-06T10:16:25.021308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.860008Z","title":"Recondreamer: Crafting world models for driving scene reconstruction via online restora- tion","venue":null,"work_id":"27a5c61a-4a50-486c-90b0-32c2fcb7fd5c","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.027525Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:add623c50d02d0a324375ec4b37c42e618989a13ae8433a91f934bd955ffd0c6","observation_id":"f916f8f5-d6ec-4e8a-b33d-e1c2f0da9113","resolution":{"observed_at":"2026-08-06T10:16:25.867244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T10:16:25.034289Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.034289Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1d23e39a8524d8bf263c978f0dee2a28769d6dbf0272d38e760ce2dae85141bd","observation_id":"33b947be-c410-403d-837c-2cdb30db6f0f","resolution":{"observed_at":"2026-08-06T10:16:25.034289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.040307Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.040307Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:d5a07a078bbc2f3491657fed3ea6d93c6012d806f79a98e8fad459d7cc89b865","observation_id":"a6d1d0ac-9b70-40a4-991e-452020146a0f","resolution":{"observed_at":"2026-08-06T10:16:25.040307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.046103Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.046103Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:07870875aa28afe93e8c1825099cec871524ff3b81c586d4f1e2eb1753292f88","observation_id":"3ed40cfc-7d3f-4c3b-b90b-28feca6f9edb","resolution":{"observed_at":"2026-08-06T10:16:25.046103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.053151Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.053151Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:d91ecf6129ee99ca3e4d8cb34b01050e8d22bb88e046c95e0380dace8d5e75a9","observation_id":"7629ee3c-368d-4faa-9ed2-17d8b213c0bb","resolution":{"observed_at":"2026-08-06T10:16:25.053151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.060499Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.060499Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:48b963a362a03d3eb2a4eeeb0c9b7b060f2e1436c7435ac43026f48c2b145d98","observation_id":"293dd31f-36d3-4237-bb29-df108da3dcd8","resolution":{"observed_at":"2026-08-06T10:16:25.060499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T10:16:25.068937Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.068937Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:36121935d036fafcaeca93d5380f81b4a1160307b1b422201d9f74ad041465c0","observation_id":"79e179b4-eba7-4aab-b0c2-e0f7eafe47ac","resolution":{"observed_at":"2026-08-06T10:16:25.068937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.077011Z","title":"Object- stitch: Object compositing with diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.077011Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:e383ea0d31b200b19870185fba82075e2a2581205638975158d5f1d2b10425e1","observation_id":"1c489a80-86e5-4ab7-ac51-649b990bb574","resolution":{"observed_at":"2026-08-06T10:16:25.077011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T10:16:25.086406Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.086406Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:abd0ae3a57a22c0dcaa00bdb3ab2e7d57d067d5a80e34e254ad7163afc3fe767","observation_id":"6529f11c-d287-4fac-953b-5ba1e316d623","resolution":{"observed_at":"2026-08-06T10:16:25.086406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.748554Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"fe237182-5112-44a5-8d8e-c9f8edec93a9","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.093477Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:9e87704034b6df9d3e5b24949f5daac860d95bd73a6467a4fedad93ecd3afbc9","observation_id":"278b15de-6716-47bc-9cec-64043197d453","resolution":{"observed_at":"2026-08-06T10:16:25.754803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-07-06T18:24:17.711867Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-06T10:16:25.100015Z","title":"Unianimate: Taming unified video diffusion mod- els for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.100015Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:2591a2f1ea6d57cdb47d17d0ca9b93b0dfe9034eb308ee80c32e601a556b03c1","observation_id":"4a87a7df-35ec-44e2-aade-c41a4a05309e","resolution":{"observed_at":"2026-08-06T10:16:25.100015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.719192Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":"d12c5d8a-1e91-4c0f-9182-69f1c68d2a64","year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.107949Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:7b8e107c415b06c79ecc4155ef44e615a8647d9cf4fbbda9ef3f0f10db14e0fa","observation_id":"7c0d608a-10e5-46ef-bb4f-cd2c987a75c7","resolution":{"observed_at":"2026-08-06T10:16:25.729069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.695150Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"c24542ed-1fd4-4547-b794-3d96c2f7a7eb","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.115568Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:5f0244f23f835a84d18993dee5798d766268e515adc112427c5a06317914da0c","observation_id":"ba92fa14-71e3-428c-b3de-32b6294b2deb","resolution":{"observed_at":"2026-08-06T10:16:25.703052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.669152Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"f2547699-a5d6-45c0-bdea-866675f7b553","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.121320Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:aea4544524706ce92728e973d1850873cdf9fc317ee6cea10000256a3d740b6e","observation_id":"dc2bce14-12f2-4c6e-92cf-7911afe5a1cc","resolution":{"observed_at":"2026-08-06T10:16:25.675918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.647518Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":"07e989f3-0865-4412-9386-af7472d4bb9d","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.127100Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:dd888f9a78f8cab06660c214cf712ef355d4f084b8d469217f96c6a6a5667ca3","observation_id":"94803cd8-7bf2-4624-9192-3ae2a51a657e","resolution":{"observed_at":"2026-08-06T10:16:25.655331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.628209Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"674d529b-8390-47c0-a128-d67bf89a23c1","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.132995Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:9129127d8080bf13e3a55aafcbe8a0cb32b6fa4329257821995cb958048ec051","observation_id":"96b44558-ee8b-4255-a4c8-8a9aadabf8c6","resolution":{"observed_at":"2026-08-06T10:16:25.633887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T10:16:25.143215Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.143215Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:3b309ecc943b2cf4bda8c6b298d26465943ed84dd2fac9d87bf1ee7bccfc578a","observation_id":"5e7b4c7b-6062-441a-a41a-df15c7f93c68","resolution":{"observed_at":"2026-08-06T10:16:25.143215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T10:16:25.151569Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.151569Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:6fc8b4eb180a4334cf35939d43d74ae3eeb2844109069507e13068b14f765bbc","observation_id":"0d1e3167-947e-4909-94d5-33eb166a5415","resolution":{"observed_at":"2026-08-06T10:16:25.151569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.160399Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.160399Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:67ceba852d777629f04ab0a6616831e655956050cb4d09b92e5496bf621396ff","observation_id":"cbd7a803-d5ef-44d0-8883-ed06cf4491b6","resolution":{"observed_at":"2026-08-06T10:16:25.160399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T10:16:25.167688Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.167688Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:04198fe1f37b29c326442ce62c12b3ec7f82cfa448a79957bc4c8be40a002bbe","observation_id":"b41ac559-04a8-4c33-b39c-e14d02517e70","resolution":{"observed_at":"2026-08-06T10:16:25.167688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.594722Z","title":"Drivedreamer4d: World models are effective data machines for 4d driving scene rep- resentation","venue":null,"work_id":"e25fc5fe-acbf-4583-88e7-60607c909455","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.174086Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:962a30dffbbde08bf9e8f154b06b9e2bb3a848dbc146db63e5591be2d7f7a6a0","observation_id":"81c170be-a10b-40bd-b804-9404866298e7","resolution":{"observed_at":"2026-08-06T10:16:25.602121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.574923Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation","venue":null,"work_id":"31557ea2-b033-44b3-afdb-be37b7464427","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.182522Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:c62014c1543e6029280038ca84635f9764aa874c00825895c87e9c3c55894f60","observation_id":"5e484dbd-cf9a-43d9-a7ef-b36e74bcbdc8","resolution":{"observed_at":"2026-08-06T10:16:25.581456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-06T10:16:25.189045Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.189045Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:57885562ca4840e317a5adadfa6bc05a3ae8f156fc066a9ecaa9d472ebc6b9a5","observation_id":"1441e9cf-66fc-4c77-bae3-035f902a7308","resolution":{"observed_at":"2026-08-06T10:16:25.189045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.548711Z","title":"Champ: Controllable and consistent human image an- imation with 3d parametric guidance","venue":null,"work_id":"f8bdfe34-e34c-4fe9-8d1e-48804943872c","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.195091Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:5ee18e1b0cc44ba2f01176931be8870e1ace0eaa46752f692e9ab22a155bde52","observation_id":"302a763e-381b-46db-917f-d4535f5dba29","resolution":{"observed_at":"2026-08-06T10:16:25.559561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T02:32:53.191949Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2508.00299."}