{"as_of":"2026-08-07T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66a0f488158ad5fa89464e5b8ce7137f4bdda2cd520b28edd6d7a7be57ce3183","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:26:54.361488Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:56:36.010447Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03723","snapshot_observed_at":"2026-08-01T13:56:36.010447Z","title":"arXiv preprint arXiv:2604.03723 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26529","last_updated":"2026-07-29T06:48:11Z","snapshot_observed_at":"2026-08-01T23:26:45.323335Z","submitted_at":"2026-07-29T06:48:11Z","title":"CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T13:56:36.010447Z"},"links":{"cited_paper":"/paper/2604.03723","citing_paper":"/paper/2607.26529"},"observation_digest":"sha256:33e2a5fb177fe9548a3b15efee93851ce39c3575a12eaa73460554dc262a3007","observation_id":"4744d1c0-259d-4a93-9b1c-4b7d8c9b44eb","resolution":{"observed_at":"2026-08-01T13:56:36.010447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.03723/citation-record","integrity":"/paper/2604.03723/integrity","json":"/paper/2604.03723/citation-record.json","paper":"/paper/2604.03723"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-06T09:54:26.134418Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Vd3d: Taming large video diffu- sion transformers for 3d camera control.arXiv preprint arXiv:2407.12781, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:9846f920cb5e0e3066729ab21c494b074498c7af41b005cdaefcb617d50c9ffb","observation_id":"5b3c1544-2bf3-4d15-b1bf-f8100b949e6c","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f91f7e47b50524078ae9e04644d2326b36c32ab7553c35816174cb13fdd5f281","observation_id":"210cc494-4315-48c4-bc3b-70af2d4b65a1","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:6eb15ae52720c9063d4c8517214ab0ecc548ea64f0a9b8466cd6dc2a40350bd0","observation_id":"4570a70a-44e3-43a2-a882-6c5ec8175920","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07760","last_updated":"2024-12-10T18:55:17Z","snapshot_observed_at":"2026-08-06T11:08:40.968563Z","submitted_at":"2024-12-10T18:55:17Z","title":"SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07760","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints.arXiv preprint arXiv:2412.07760, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2412.07760","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:615d1d1463850c61a1ecb73524d4dbfa8c0d19bccbbcb7bc64e677a3cbde8912","observation_id":"6f8c1890-d18e-4319-aeed-310d7f052b03","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:c0c10e82de6bb29640aa98fe00014d0c9205f37da6ba88d45ec27029210afa0c","observation_id":"fda0fe97-2a30-4dde-b193-a9fde3c8f184","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Depth pro: Sharp monocular metric depth in less than a second.arXiv preprint arXiv:2410.02073, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:151d46c456676b0dfad6167dedb4b023d4023fa50bcd56c2a5955a7f466c7708","observation_id":"c1d4a2af-f6f1-4a8e-b9f8-e359d8456bcf","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Uni3c: Unifying precisely 3d-enhanced camera and human motion controls for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:b4dc1b2d69f54084ac4defecaf223fd5acf00401880265aae202ac17168e4df1","observation_id":"0290ba24-9a07-4998-a576-fbc9b1801a9f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05020","last_updated":"2025-03-10T10:46:31Z","snapshot_observed_at":"2026-08-04T15:09:32.260471Z","submitted_at":"2025-01-09T07:23:48Z","title":"Perception-as-Control: Fine-grained Controllable Image Animation with 3D-aware Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05020","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Perception-as-control: Fine-grained control- lable image animation with 3d-aware motion representation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2501.05020","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:d5499cc671b9f48289542c047fe65d8c1826049607f780cae628e878216ba5a0","observation_id":"72b4b0bc-9268-41cd-97c0-f63f340152bf","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Wan-move: Motion- controllable video generation via latent trajectory guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:26e09e1481b48e848ba17cfab0dc5d0e54f27351a2e633eb64b437f76d09c783","observation_id":"352cc9ff-3c70-4d10-bec3-efc1ba4226ea","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-04T20:02:02.999092Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining.arXiv preprint arXiv:2304.09151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:35b159601ed8b4f430e9d13d18d947e85d08b37a3500d71dc9e7cbb30e3e6c68","observation_id":"ff1b578b-5f2a-4657-868b-53954f229892","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06525","last_updated":"2025-02-28T06:40:38Z","snapshot_observed_at":"2026-07-06T19:48:05.525731Z","submitted_at":"2024-11-10T16:59:39Z","title":"I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06525","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"I2vcontrol-camera: Precise video camera control with adjustable motion strength.arXiv preprint arXiv:2411.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2411.06525","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:cf116ead85f68bbbb812c333203366e5446429e21d9b6faca9dc80844d49ed58","observation_id":"8527bacc-6d6c-42b9-a521-51e6c6749005","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07759","last_updated":"2025-07-04T03:57:48Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:55:13Z","title":"3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07759","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"3dtrajmaster: Mastering 3d trajectory for multi-entity motion in video generation.arXiv preprint arXiv:2412.07759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2412.07759","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:716db05ec3347181fb93424b6fb046afdbee42c21b62d2865002a2731edc4ab0","observation_id":"20473482-3f67-41e4-be3d-01ad6c04ec74","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Motion prompting: Controlling video generation with motion trajec- tories","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:d50580992552f561345e7e7a899355a2fa052bf8e3f6a16e7948140a56872edc","observation_id":"6655f104-77ae-4cbc-a023-bd3b59a992a5","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Cameractrl: Enabling camera control for text-to-video generation.arXiv preprint arXiv:2404.02101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:3f682afce9a8113c8356a877b0ae2b025e91fae12fa33a2b3c4ea3c180074324","observation_id":"e738a0b7-9ead-476b-90d6-32ee0ab2124f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10592","last_updated":"2025-03-13T17:42:01Z","snapshot_observed_at":"2026-08-07T17:06:18.240718Z","submitted_at":"2025-03-13T17:42:01Z","title":"CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10592","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Cameractrl ii: Dynamic scene exploration via camera-controlled video diffusion models.arXiv preprint arXiv:2503.10592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2503.10592","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:5bf4eebe6bf7c5274be7afd3aa369c4a5cd415bc9f09b3626a2d879192dba1c7","observation_id":"256f6628-7e17-4bd3-b44b-4e789078770f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10126","last_updated":"2025-02-25T00:32:29Z","snapshot_observed_at":"2026-08-07T18:45:05.745904Z","submitted_at":"2024-06-14T15:33:00Z","title":"Training-free Camera Control for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10126","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Training-free camera control for video generation.arXiv preprint arXiv:2406.10126, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2406.10126","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:1f3e10951e012d2856a25510f7623c2468f4d401022e9e836fc58e96f0836504","observation_id":"799e4e8c-092d-4944-bac8-f1bbe56aa034","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-07-06T18:04:54.726338Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Mo- tionmaster: Training-free camera motion transfer for video generation.arXiv preprint arXiv:2404.15789, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:326f9e074260ea7a67ab6fa72309c63bd9ee141a4beef25e347650b6f96596b5","observation_id":"623f3e16-80e7-40ed-b781-b117b11b186c","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Live: Long- horizon interactive video world modeling.arXiv preprint arXiv:2602.03747, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:4f282bc65e8f25c2955a8f4dacb477e4676baba3e877f933e890b4a2207d4732","observation_id":"7658da95-906e-4c46-9842-379c604aeb7b","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Segment any motion in videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:13b7bb101446609a5c15a8bf44bf6f0fae93cd32cae2ef81d13c0127d13cc54d","observation_id":"2c5cdc0a-e783-4305-8efc-f7ed5668e30f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Peekaboo: Interactive video generation via masked- diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:8a7d79a7cd3addf77b52a586c1f0e24806b59e0f8dde7ec0d4178c3259e44c7b","observation_id":"422f6fe1-e3ea-490d-8938-3bb6b38d7d1b","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Collab- orative video diffusion: Consistent multi-video generation with camera control.Advances in Neural Information Pro- cessing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f3a16c2d8a7c18c9bb1632e8588826bd23608390df1d97030b1bb53c46f41e45","observation_id":"9b4b0ac8-a3fd-4964-8581-7c4a1553e409","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Magicmotion: Controllable video genera- tion with dense-to-sparse trajectory guidance.arXiv preprint arXiv:2503.16421, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:63ed651013e6b5608ab8ac4f99fc979c11bc240ca311d864cc51af5370fec096","observation_id":"b00b1042-f93d-46cc-8bbf-318c5e981f7a","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:74aeba51655f241c90694ab118753168d4d28fbf6edfa9cb2fc0d5572719480b","observation_id":"1dd5f25c-092e-474c-a9a2-ec74fd5e1799","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Image conductor: Precision control for interactive video syn- thesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:049e1491d5a69b83885fe5632bdcab1f52a12ec61332b2a0c43053448f46d243","observation_id":"39e339dc-7d08-47d2-bd5f-5e3ccb8855c3","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Toward a practical perceptual video quality metric, 2016.Dostupno na: http://techblog","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:9f02562b51036d9f638a50459861a14793b1f39e0ca42b7b2bc1175d8458c6b9","observation_id":"0826f104-aa86-4648-8684-317879e69123","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Megasam: Accurate, fast and ro- bust structure and motion from casual dynamic videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:427a9610ff8132ac7f9ccf70842e566be9a6a4661df2f59c6b2742e45d9a2020","observation_id":"e11c8500-7c88-4914-a94f-bfb46f711015","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Wonderland: Nav- igating 3d scenes from a single image.arXiv preprint arXiv:2412.12091, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:447844e284e14c48f7502995c53d59f1e67dff357869cb486ec573d7bc66b905","observation_id":"7e46334a-3d55-4bc8-a617-30b8fb32c596","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Real-time scene text detection with differentiable binarization and adaptive scale fusion.IEEE transactions on pattern analysis and machine intelligence, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:2e1944d8209b9dca8534eb2b59605c2212f5a59a59d138aecd40ab41c776e767","observation_id":"49827fba-ac37-4fb4-af14-0dcb86a115e1","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Motionclone: Training-free motion cloning for controllable video generation.arXiv preprint arXiv:2406.05338, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:859ec670a43af71f622f0f01ecea647e7d69fcf54673a4e56b40cfaa065ba09f","observation_id":"c83f17c1-126c-41dd-af40-66d82e29670d","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Flow matching for generative mod- eling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f396226f880ec8c7773a0aed9018ccf07ab17c8cff07818412ed99fe0c7a3029","observation_id":"e05e08c2-4e6a-4a5c-aa69-898080907290","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:c3bda7c6cabe0ec2066adc64fefeeaaca794afd5df6622c28f76cb9b19b9abc0","observation_id":"9d6a8a35-59a2-411a-89d2-666c7ccf1bed","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:a6f94af64da1588808e846e9f8cd78e46e9ecf0c43a1973675952e53c60227ac","observation_id":"21cf2cad-340f-4ab5-a118-b3578aaf6482","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:fa24f2298b198bb41ad96e5f178547e6f2ce3925bbd590feb9b1973c611db971","observation_id":"4f7b96d6-fb1d-4ed9-88bc-6efc095bffde","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-02T05:41:31.119340Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:c5fe05338233cd71084fe467905d891c953c51b97e979d273e983e01f82137f1","observation_id":"b079e877-764a-4004-9dac-624fa462d1aa","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16863","last_updated":"2024-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:56Z","title":"FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16863","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Freetraj: Tuning-free tra- jectory control in video diffusion models.arXiv preprint arXiv:2406.16863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2406.16863","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:fc63c62bd5349c2b089a5c8dc74d289af9b128f11a820c8183449944ddd78d5d","observation_id":"93c2ee8f-218f-4e6b-b7ca-27ccf8b196cf","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:d3616577d2a966a64c8e4b74ae11a728506dd426098f4f6dc1033212950174d4","observation_id":"22c8b177-95ff-4dd3-9919-972df7719d29","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:115d520810763a7f2865298d0eb48f18669f4251f289d7724f65a5a26cea81f5","observation_id":"d2dacb82-7e71-4a56-8bb9-93686909aa1a","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:47566ddff336ef80cd56718e23f90eb5ad1c287557716ee074239637db9e63f8","observation_id":"169106ec-77e7-4156-8790-a7b65f74f423","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:5c0733bb1fb64aa292407963b848bc2e38249d8bdd6925640157128414fb3ef4","observation_id":"12b7499c-a100-4706-8a74-c9ef9a1e847c","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"pytorch-fid: Fid score for pytorch","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:e6340c07dca74eaaca1a1afe3d6f3196eb74ecb0d51714494df77722ef8db9a7","observation_id":"375bb6da-e7ac-49b5-b3e7-b78c367f9601","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:77e43ba25c9f79dad543843f641fc221930b882030e9b30277c77b944aaa1584","observation_id":"1edf27d9-eaf2-4765-ab09-056690e0548f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Free-form motion control: Controlling the 6d poses of camera and objects in video gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:497110c4b7cf3899863d4df2c43aa5ff54e58967d085d80043e6176892b3b8e8","observation_id":"a7e51f83-65db-4a12-b3cf-4c5674003e88","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Light field networks: Neural scene representations with single-evaluation rendering.Ad- vances in Neural Information Processing Systems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:bc2eabf84b01cac05fed90a981018aa6e8777dd1772b49a2ffc9f80eec70de00","observation_id":"f8c53850-6cbd-47a3-807c-85b84e79049b","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"To- wards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:ca9d8370a38dcb4f84102ff43086345e19320808234d7a304647033953e86ad6","observation_id":"0bf3e9a7-9de6-4bba-a838-af761b1c538f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Wan: Open and advanced large-scale video gen- erative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:3b4cdc691aee5ead65409ac28a24898dfb3a50ca18e17ebe549a6e3234f3256b","observation_id":"6a434202-9666-4330-98f4-eb4d279c9834","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22944","last_updated":"2025-06-10T06:15:58Z","snapshot_observed_at":"2026-08-07T12:54:34.367036Z","submitted_at":"2025-05-28T23:49:18Z","title":"ATI: Any Trajectory Instruction for Controllable Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22944","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Ati: Any trajectory in- struction for controllable video generation.arXiv preprint arXiv:2505.22944, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2505.22944","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:1d299e1a0f9b50b5f16acffb189c0ea229bd2256adbb884706036f1ae0ef7769","observation_id":"01f3f6ea-ce09-4504-8170-a3d6ce38cf09","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Levitor: 3d trajectory oriented image-to-video syn- thesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:b865c242ca01414b32ecc2d3e65207cedc08713965e1dff965fb26df808a9d99","observation_id":"06e05043-e646-432a-8240-b68e5f4b0f94","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Boximator: Generat- ing rich and controllable motions for video synthesis.arXiv preprint arXiv:2402.01566, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:4243ea9b85308739cb5e09617ddd581fc439f8d941ca8aa28d9f0d350a8b92a4","observation_id":"1c63e3fc-4bbb-40cc-80dc-1ad31fb3d5ed","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f4e3fa2c8d0068c97a9377be53449e40682e3b8e6e98745260b7eb9fc5622111","observation_id":"9a64728f-f1ae-4101-8920-4fee2bf2b91f","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-07-06T11:05:04.853545Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Godiva: Gen- erating open-domain videos from natural descriptions.arXiv preprint arXiv:2104.14806, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:dacf41f9f48557496cf5a6e2bee0b8f267e46b82c9f8d7a3f3041502f4e811c7","observation_id":"3f014e44-931a-4dc4-9c7e-bdc9b021c4f6","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Development of an image data set of construction machines for deep learning object detection.Journal of Computing in Civil Engineering, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:0191303cb825d8e1d2f48a7a2edc9f2f829ffe4a901b4303a330e776fe1b7d3f","observation_id":"21e99fb8-e3ce-41a8-b47b-c2858c93c8d0","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12462","last_updated":"2025-07-19T02:07:12Z","snapshot_observed_at":"2026-08-07T14:04:21.079312Z","submitted_at":"2025-07-16T17:59:03Z","title":"SpatialTrackerV2: 3D Point Tracking Made Easy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12462","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Spatialtrackerv2: 3d point tracking made easy.arXiv preprint arXiv:2507.12462, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2507.12462","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:2f5e4fcb897d3619df328b645437bde8b85907b9d7954978b247dd92eb5dc492","observation_id":"6efd6931-9d80-4b03-850f-28fc0d0cc993","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation.arXiv preprint arXiv:2406.02509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f3ac58d6fc4cc73cf72291ae8f9f264e7980fdf08e6a5bf56d9281fda7988b25","observation_id":"40066946-e3c9-4100-bdee-9631312af351","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Depth any- thing v2.Advances in Neural Information Processing Sys- tems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f3470660bed62f32dede1c5167ce1a2cfe354984779513a01a12ae901b5ce737","observation_id":"d1263e7d-65e8-464a-8894-c949cd0d268c","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory.arXiv preprint arXiv:2308.08089, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:f69e90a80aabaa76cf4d51486dfd3886327550acba3a6f2b79f03f970b1773e8","observation_id":"b12c2646-8f2d-4cb3-a8a1-98ee595a970d","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Viewcrafter: Taming video diffusion models for high-fidelity novel view synthesis.arXiv preprint arXiv:2409.02048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:3805b4279595b0738a5cbfae88d444354bdf4113e6a88d27e4a7f93099ff588a","observation_id":"acd5bc2b-f33c-4986-8800-eaafb14184d5","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Proteus-id: Id- consistent and motion-coherent video customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:ea2dd3f0150b2629fa8983113a0e25528e1fd17efce14f8212cb14994a0b009c","observation_id":"37469868-d2f7-4d4b-9c33-72fdc8539312","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Tora: Trajectory-oriented diffusion transformer for video genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:18fe07dcb093358b947a360f905f461f3ec9839b9d74eb36babd81dc584ae473","observation_id":"8c753600-2ab6-4791-809b-a7ed045a4a6e","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07531","last_updated":"2026-06-17T07:15:21Z","snapshot_observed_at":"2026-07-06T20:34:44.083385Z","submitted_at":"2025-02-11T13:11:59Z","title":"VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07531","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Vidcraft3: Camera, object, and lighting control for image-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/2502.07531","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:0d587ee84674399c18904d7eb67a8d124dae2da9ba544670bdbd6ae2605865e3","observation_id":"23d11c90-0784-45ff-bcb3-65873605e4f3","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Trackgo: A flexible and efficient method for controllable video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:c637a7f771dab558e4570c43367fe95ae1b181d2907d99c8947f909f174e0210","observation_id":"3db17dcd-efe9-4ebd-8d66-1aa573b7e3e2","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Stereo magnification: Learning view synthesis using multiplane images.arXiv preprint arXiv:1805.09817, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:e1b30f53db2da20110701030577016434591f431ad7532966d2f3a749ff7d8e2","observation_id":"ce1a7ca7-030f-4caf-9a3e-82c17aa408f8","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:26:54.361488Z","title":"Omniworld: A multi-domain and multi-modal dataset for 4d world modeling.arXiv preprint arXiv:2509.12201, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T12:26:54.361488Z"},"links":{"citing_paper":"/paper/2604.03723"},"observation_digest":"sha256:8401415846a41e2ed4f94b03069dc34f6c9e3e7f3f43e97e1915e6453a39f284","observation_id":"82695cbf-66f9-4104-ac4d-6e0040f66b37","resolution":{"observed_at":"2026-07-13T12:26:54.361488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.03723","last_updated":"2026-06-24T08:25:16Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:57:30.700520Z","submitted_at":"2026-04-04T12:59:24Z","title":"SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2604.03723."}