{"as_of":"2026-08-14T15:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6650b272d8233a7facf84379c9cff60d97a65bc9769badb1c1bc8e30b7d7b093","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:11:41.595985Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:02:56.732859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:03:48.615075Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-08T00:02:56.732859Z","title":"Gs-dit: Ad- vancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-09T23:14:28.470569Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.732859Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:4c96c5892e89a520167f39b3d677fe7740d241966d74bfe82094d6121c0c1892","observation_id":"34234d4e-dc0f-4f30-8bb2-6e4825a8fa9a","resolution":{"observed_at":"2026-08-08T00:02:56.732859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-07T13:28:09.083677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-14T12:12:34.816304Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:09.083677Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:93c116e7af20a910ac7c239f65af5fb479cc06db28ae7738ca5132aea9bd9ee0","observation_id":"46e59359-72ce-48ad-979a-e0678dcede1c","resolution":{"observed_at":"2026-08-07T13:28:09.083677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-07T11:47:00.816915Z","title":"Gs-dit: Advancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking.arXiv preprint arXiv:2501.02690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01546","last_updated":"2025-06-02T11:19:23Z","snapshot_observed_at":"2026-08-13T20:34:18.512737Z","submitted_at":"2025-06-02T11:19:23Z","title":"LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:47:00.816915Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2506.01546"},"observation_digest":"sha256:93f0146b826469f6bc65f1d8d212fd3a5fade4a60a727abfd84e2c5d3d3a2482","observation_id":"bcb3a2dc-f5c6-4b1b-8e26-99e76102c154","resolution":{"observed_at":"2026-08-07T11:47:00.816915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-07T05:28:14.808499Z","title":"arXiv preprint arXiv:2501.02690 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08004","last_updated":"2025-06-09T17:59:47Z","snapshot_observed_at":"2026-08-13T18:47:51.421645Z","submitted_at":"2025-06-09T17:59:47Z","title":"Dynamic View Synthesis as an Inverse Problem","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:14.808499Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2506.08004"},"observation_digest":"sha256:40eee81a24d9f1b180570d6c2525302c2bbd9eafa1208a099eabf0d94d8fb98e","observation_id":"819be1a9-7ce7-44a3-b563-983ba787ce5c","resolution":{"observed_at":"2026-08-07T05:28:14.808499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-06T16:49:47.716661Z","title":"Gs-dit: Advancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12462","last_updated":"2025-07-19T02:07:12Z","snapshot_observed_at":"2026-08-08T08:02:10.460729Z","submitted_at":"2025-07-16T17:59:03Z","title":"SpatialTrackerV2: 3D Point Tracking Made Easy","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:47.716661Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2507.12462"},"observation_digest":"sha256:705c9bb3400cc7e07096f9c74c6cf1becd23dc52742a76f45c5cb382cdd3ee57","observation_id":"c9fe4659-3835-4702-812d-2cb25c401489","resolution":{"observed_at":"2026-08-06T16:49:47.716661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-03T21:01:06.699695Z","title":"Gs-dit: Advancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking.arXiv preprint arXiv:2501.02690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17185","last_updated":"2026-05-29T08:17:11Z","snapshot_observed_at":"2026-08-03T21:01:05.108421Z","submitted_at":"2025-11-21T12:05:46Z","title":"PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:01:06.699695Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2511.17185"},"observation_digest":"sha256:85a07708f7e3fb8bdfa1d19885e61980c6eda505338ff3c3807783090b57257d","observation_id":"edb73e95-bf3e-4f48-a8f9-b3f92a0381e6","resolution":{"observed_at":"2026-08-03T21:01:06.699695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-08-03T18:30:01.713076Z","title":"Gs-dit: Advancing video generation with pseudo 4d gaussian fields through efficient dense 3d point tracking.arXiv preprint arXiv:2501.02690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05044","last_updated":"2026-07-08T17:50:45Z","snapshot_observed_at":"2026-08-14T15:21:43.350488Z","submitted_at":"2025-12-04T17:59:10Z","title":"Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:30:01.713076Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2512.05044"},"observation_digest":"sha256:6fe47887d27813b150ebe947cc97fe78c0f1ce4292598fd75ba4ca97535ecf2e","observation_id":"cac36ea8-15a7-41a3-b34f-14b5fe207906","resolution":{"observed_at":"2026-08-03T18:30:01.713076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2604.04911","last_updated":"2026-04-08T04:54:06Z","snapshot_observed_at":"2026-08-12T15:46:16.847409Z","submitted_at":"2026-04-06T17:54:42Z","title":"SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:23:50.614589Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2604.04911"},"observation_digest":"sha256:4d2cb78795f8ee49767909ce9a0dd1877f25b1d42abf47d00f54b673c86ab5d4","observation_id":"dbf7bc88-0be4-46cd-9dc3-a75411e3eaa6","resolution":{"observed_at":"2026-05-10T23:00:50.473622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2604.06010","last_updated":"2026-04-07T16:06:02Z","snapshot_observed_at":"2026-08-11T06:31:59.653450Z","submitted_at":"2026-04-07T16:06:02Z","title":"OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T20:11:35.077141Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2604.06010"},"observation_digest":"sha256:9e13128023b3354dcc3509da0d26ecf87bcb797d1e04361af2447b8b03d2c96c","observation_id":"43f19e51-bdbf-4a51-884d-6fbab51271de","resolution":{"observed_at":"2026-05-10T22:10:48.794280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:8177ba0c775e29b2732376b88217357d4d8799c67ecc600a5330f15820948e3f","observation_id":"a16bc054-ed40-489c-bc6a-383adaba7300","resolution":{"observed_at":"2026-05-10T23:25:53.558680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2606.27345","last_updated":"2026-08-12T17:22:33Z","snapshot_observed_at":"2026-08-14T15:22:10.816617Z","submitted_at":"2026-06-25T17:51:02Z","title":"SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T05:14:02.088474Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2606.27345"},"observation_digest":"sha256:d352566caf13283acb4f171d9da0e9d6afe328e9753b4f77a38a7bd299ec609a","observation_id":"c3d81bdf-9bd8-409f-91e7-4239faac563c","resolution":{"observed_at":"2026-07-04T13:29:51.190250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2606.27345","last_updated":"2026-08-12T17:22:33Z","snapshot_observed_at":"2026-08-14T15:22:10.816617Z","submitted_at":"2026-06-25T17:51:02Z","title":"SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:04.281000Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2606.27345"},"observation_digest":"sha256:59f89f6fe80c580ea68bf2222c3c54a1fc4fc05e2b55f8616728b02c459cb78e","observation_id":"f5c90ce4-6040-4a8a-92ab-5089a7b0d498","resolution":{"observed_at":"2026-06-29T20:03:57.064581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"cited_work":{"arxiv_id":"2501.02690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02690","snapshot_observed_at":"2026-07-07T14:03:48.615075Z","title":"GS-DiT: Ad- vancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","venue":"cs.CV","work_id":"3317bf96-b12e-49d7-918d-06233e00c8b8","year":2025},"citing_paper":{"arxiv_id":"2607.05376","last_updated":"2026-07-06T17:54:16Z","snapshot_observed_at":"2026-07-09T23:18:25.821956Z","submitted_at":"2026-07-06T17:54:16Z","title":"MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-07T13:58:13.194386Z"},"links":{"cited_paper":"/paper/2501.02690","citing_paper":"/paper/2607.05376"},"observation_digest":"sha256:cba210ac243663605ffe9775fdc0ea06c8268f177ed841c44a9c5abe4ebab563","observation_id":"1ec0ef94-1eea-4a65-bed6-826dbe26665f","resolution":{"observed_at":"2026-07-07T14:03:48.616611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02690/citation-record","integrity":"/paper/2501.02690/integrity","json":"/paper/2501.02690/citation-record.json","paper":"/paper/2501.02690"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-08-14T01:11:07.622125Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-10T22:11:41.321479Z","title":"Deep learning using rectified linear units (relu)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.321479Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:13a313ff0391ffde97ab982c8e105c33626d4dfec78720349b517aff5c50c1ea","observation_id":"a45d39da-6dd9-4233-b90c-d448a2abbc67","resolution":{"observed_at":"2026-08-10T22:11:41.321479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.376833Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"9d7e09ed-7721-4dd5-979c-bca87b02db80","year":2021},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.331523Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:07605cc6263cadf4da44eab402e7f88bac3ca4dcdf487d70c4fd60992177169c","observation_id":"cc976e58-5c9f-42d1-89d0-d99a513911b5","resolution":{"observed_at":"2026-08-10T22:11:42.380979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.335226Z","title":"4d visualization of dynamic events from unconstrained multi-view videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.335226Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:3c0f304e97020c607ac4bead1a01ac71122a494097492dc3c24bfaf6e5c511ac","observation_id":"7c236333-e20f-4930-ab43-d488b83c2c6d","resolution":{"observed_at":"2026-08-10T22:11:41.335226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-10T22:11:41.356516Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.356516Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:02871346040a5d422e384a6705f452f9a251a559e42a7cb18c63a0a20a3e038f","observation_id":"557de4b4-98fe-4d2d-a18a-9bcdd1ad0fd2","resolution":{"observed_at":"2026-08-10T22:11:41.356516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.361552Z","title":"Context-pips: Persistent in- dependent particles demands spatial context features","venue":null,"work_id":"61396ec4-41f6-46b3-b67d-8912bdc6900e","year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.366306Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:657de9ad0797525eeea0d8c22659e5eeaed90dc431e5a23e97f2128f630a1e99","observation_id":"7dd1373a-f2cd-4af5-b213-0076bcbe5cb6","resolution":{"observed_at":"2026-08-10T22:11:42.365016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T22:11:41.379518Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.379518Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:47893c975308f47f8db340e8fccd7313c023a865154e05561d557e5f4d0a1529","observation_id":"bc019434-7615-4d20-a0e5-8508171e92ca","resolution":{"observed_at":"2026-08-10T22:11:41.379518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.383261Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.383261Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:18be7c6d4e6b4d4e6610893b875cefb0cf3356b2c2ef4197004266aabe0dc6e6","observation_id":"61f7886c-b782-407d-bd67-bb68fa4609be","resolution":{"observed_at":"2026-08-10T22:11:41.383261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.386223Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.386223Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:0b2a7967ca6b96c22c886ac61ade11e729e7f5a2c4c1f6d6d14d1470b99b04a5","observation_id":"5f9eb097-9ab3-4cab-bf78-ec42b40f3ae9","resolution":{"observed_at":"2026-08-10T22:11:41.386223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06738","last_updated":"2024-03-11T14:03:36Z","snapshot_observed_at":"2026-08-13T00:57:37.478128Z","submitted_at":"2024-03-11T14:03:36Z","title":"V3D: Video Diffusion Models are Effective 3D Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06738","snapshot_observed_at":"2026-08-10T22:11:41.389577Z","title":"V3d: Video diffusion models are effective 3d generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.389577Z"},"links":{"cited_paper":"/paper/2403.06738","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:a64143067b0a0a0e6033d16e2cebab03988cb6110242a9f20162b7a37bf9981b","observation_id":"1c2198ad-ebef-47d7-87c8-dec8bd4f5d19","resolution":{"observed_at":"2026-08-10T22:11:41.389577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.392509Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.392509Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:be6e48bd4ce68478ece51132eedb0e355a91f7721e6e5c5c2d3ba7e908d9d328","observation_id":"b02c96bb-d369-4d63-b215-dae478954c34","resolution":{"observed_at":"2026-08-10T22:11:41.392509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.338802Z","title":"TAP-vid: A benchmark for track- ing any point in a video","venue":null,"work_id":"629537fe-21cb-48ab-ae83-35b310f7ba2f","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.395142Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:4ba29ad93c6c7c08e97179caa456c3fb1f82af30379c9b0aefaf34b0476ab19a","observation_id":"0a87284d-4d17-4b2f-bb36-117ef2119cd9","resolution":{"observed_at":"2026-08-10T22:11:42.342469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.316095Z","title":"Tapir: Tracking any point with per-frame initialization and temporal refinement","venue":null,"work_id":"360fc135-3605-420c-83a0-e19a25c18b45","year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.398084Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:f32b363df11d3682a4806689da93002802fd6e1a6137492fa8602b0c11a127b1","observation_id":"0200e048-07ef-4dd5-8986-44eb7ac21619","resolution":{"observed_at":"2026-08-10T22:11:42.322781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.400872Z","title":"Boot- sTAP: Bootstrapped training for tracking-any-point","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.400872Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:2019cf7f8c206fa841629d60c618137e92c82c0593d8277c297b7a2d4dc486d1","observation_id":"8daa3a62-083a-42e5-9c4c-aa63e7dbe022","resolution":{"observed_at":"2026-08-10T22:11:41.400872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.297501Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"8b0e21ba-5b26-4aee-9bdf-2709fe7b75ac","year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.403673Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:a872a0f52381042be6bc99c97df5c0fd3c134c9d4023fb6899d72f900cc37bd9","observation_id":"bfad57ee-6bd6-472b-ae31-9981021cec95","resolution":{"observed_at":"2026-08-10T22:11:42.300721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.414746Z","title":"Dynamic view synthesis from dynamic monocular video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.414746Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:4285120cff7a42329ae62d5397404494672c1600141035ff78ba648a6fe75058","observation_id":"928849ed-2443-4324-b6d6-5f28f4c08c8f","resolution":{"observed_at":"2026-08-10T22:11:41.414746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.282090Z","title":"Monocular dynamic view synthesis: A reality check","venue":null,"work_id":"a6d0c6c7-8c5f-4f3d-8aff-297445153f1e","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.417846Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:d87b1fa941974dc3cb66dc28ca7da1cf4c44d8d8b71719146ad5834ee7aeba3e","observation_id":"1ccf565f-9ae8-4d95-add2-e8b733dc1c02","resolution":{"observed_at":"2026-08-10T22:11:42.287759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.422463Z","title":"Fine-tuning image-conditional diffusion models is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.422463Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:68d823419dc4f8e6dde08b2718459218674f81d189233395eba55abc26075c50","observation_id":"2afa646b-a3ea-4b91-9459-5c2e080919a1","resolution":{"observed_at":"2026-08-10T22:11:41.422463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.266531Z","title":null,"venue":null,"work_id":"ab6ba1a0-c219-4ab2-bdcb-6003a30841d2","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.425260Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:3063a46db30359067849592b6b8248c957c3a79795d9533afb45c2a66b78635e","observation_id":"7a8a6621-8418-420f-a1b0-49b9bc55701c","resolution":{"observed_at":"2026-08-10T22:11:42.270461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.429213Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.429213Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:c0f3ae944edca5a8498778feb5629a8d77d6bc48728ac5ab2f56f23271a5cfa8","observation_id":"279f04fe-7436-423f-8329-aaade32ad2cd","resolution":{"observed_at":"2026-08-10T22:11:41.429213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.244751Z","title":"Particle video revisited: Tracking through occlusions using point trajectories","venue":null,"work_id":"d7a0b83e-6896-47ad-bb5a-4b4e0dc82dc0","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.433881Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:180f206d49a796dea2125987f8cfd3d31285eff55bdcbc0756d7bb1ae5bf8e3f","observation_id":"00373cc5-18cd-4247-9ad5-70d70fb811be","resolution":{"observed_at":"2026-08-10T22:11:42.250302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.234177Z","title":"Flexible diffusion modeling of long videos","venue":null,"work_id":"756803cd-245d-4666-a8ef-858fafd56937","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.438394Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:fd2b6794b430ef25b2d62c31a7c8c61fe4fc4a84bf6f8587823d2a175556248c","observation_id":"175c49f6-ae26-428d-89ff-af52bcbda1b5","resolution":{"observed_at":"2026-08-10T22:11:42.237653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T22:11:41.441059Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.441059Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:0e803d98d3a33ce9871e40197f8e1a6afb709b0e1f2561e97736b30a571b9eaa","observation_id":"84b83e41-c3da-4ceb-92cf-4f867214160c","resolution":{"observed_at":"2026-08-10T22:11:41.441059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T22:11:41.444880Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.444880Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:27adafe8dfe14fef8e700239d261e2b8e174448a76719adf26f40e0c549881e1","observation_id":"49df66be-46b6-45eb-bfe4-791227ab4740","resolution":{"observed_at":"2026-08-10T22:11:41.444880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.452030Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.452030Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:9f67c2c478787166c7f3df74185d8701feeceb53cc20e0d9e2cf21fef43a1a5f","observation_id":"8485d481-32b9-4d6d-97aa-0e4d7363f52d","resolution":{"observed_at":"2026-08-10T22:11:41.452030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T22:11:41.455196Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.455196Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:86eea01beb8f5f4b61ad10381149f3625a61a8af24674de252bf109357a74426","observation_id":"78c013ff-bc89-4bab-a21c-2d8245bc2019","resolution":{"observed_at":"2026-08-10T22:11:41.455196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.464748Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.464748Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:17843219897131d1e327c2059cf742a8a0b7fce3471a21802069e50481fe00b1","observation_id":"01aeb105-50c7-41ac-9d40-213dd0c80c0f","resolution":{"observed_at":"2026-08-10T22:11:41.464748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.206484Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":"d94513e3-232c-463c-b471-b0f011be1069","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.473747Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:1843848727428be4ccce87242ea65bc84624a9989b713da1133fd48624e1fece","observation_id":"f5019e42-55b6-4550-a89a-19db6d55c9c7","resolution":{"observed_at":"2026-08-10T22:11:42.211897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.481537Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.481537Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:160c790e6229d9a3187eba738308543dd85402d361c7e0e07ac337590e6cb432","observation_id":"ff1a551f-db56-45cd-98eb-6c82f88a6211","resolution":{"observed_at":"2026-08-10T22:11:41.481537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.486075Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.486075Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:cb30bc5be44d7e75680e23a4723cf0d46bce118d6bb9bebfdab4a95906e02b83","observation_id":"6644225c-f22f-4663-9244-0d1555bf9b0d","resolution":{"observed_at":"2026-08-10T22:11:41.486075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.490293Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.490293Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:33370d0282c20ba8e314da99b4089479fbd13e164f37bd683ba37050d04f1472","observation_id":"3ece126a-f2d2-40f9-ab54-924b341e1e36","resolution":{"observed_at":"2026-08-10T22:11:41.490293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.179439Z","title":"TAPVid-3D: A benchmark for tracking any point in 3D","venue":null,"work_id":"bc0752cb-0b9e-4e3f-9b2b-56e871bbe2cb","year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.494781Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:935efe8fbafc734b5b20d421bb370e5f74a32906ff2549de0d0f3b089b0adbb3","observation_id":"0b7b81b7-0add-4cc3-989e-25c84455ff51","resolution":{"observed_at":"2026-08-10T22:11:42.183014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.169539Z","title":"Dense optical tracking: Connecting the dots","venue":null,"work_id":"37685b92-ce0f-45e2-a33e-eea6760aab81","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.500560Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:e003a3ff158538553370e70773d4935be3fd9d11626a872083f38262c8216cab","observation_id":"19e04748-e20c-467f-bd2e-d38dbe4ae9b4","resolution":{"observed_at":"2026-08-10T22:11:42.174111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-10T22:11:41.503959Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.503959Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:a85a53053f21a4d98a8e3ad968ed29453fb23990959c8b15ac480be709cd39d7","observation_id":"794e048d-5bf0-4316-bbb3-3798e54477aa","resolution":{"observed_at":"2026-08-10T22:11:41.503959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.519747Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.519747Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:4d3f151aba4914828c622a0271fc7fc61f6927322ab979fafee1bb6444c91688","observation_id":"359bd700-8796-456a-a400-5204ac0bdcdc","resolution":{"observed_at":"2026-08-10T22:11:41.519747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.149990Z","title":"pix2gestalt: Amodal segmentation by synthesizing wholes","venue":null,"work_id":"e883cce1-321e-4a40-bdd7-094af5972661","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.524113Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:d6f753da55b1538fbd1c609a45709a7894410f72c606c46e41e2f9921f3fc577","observation_id":"c7062ee4-bf95-4330-96b0-35815f6a36c4","resolution":{"observed_at":"2026-08-10T22:11:42.153448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.527089Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.527089Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:776334599ef46e55efb76638dc1dcefc1afaa1a86b309df9add98fc206a8c730","observation_id":"f45f01c0-ba62-4352-abd6-3aac142a16f9","resolution":{"observed_at":"2026-08-10T22:11:41.527089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.128528Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":"d60c0047-5f37-4604-9717-7a84679f19bd","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.531036Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:019d7449ee2c60db8d8d61db8a9bdb97dd8e19a1adfc2f8d32c88f87650ef111","observation_id":"fa0e8023-90ad-4174-8c96-e9ec81910407","resolution":{"observed_at":"2026-08-10T22:11:42.137130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-10T22:11:41.533987Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.533987Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:4f11ae06a5b4bd4123c6d86229227d373c29f20c9ae782a4a21f8dbe61a1866e","observation_id":"b1411d4a-a680-4aa4-a2c2-fb27ee939697","resolution":{"observed_at":"2026-08-10T22:11:41.533987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.537111Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.537111Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:a77cfcbad729d49dc08607fa5a9badeb54ad7455c1eb0d2972014c2fb261fd1a","observation_id":"7f529154-9bea-48e8-98ee-be935127745c","resolution":{"observed_at":"2026-08-10T22:11:41.537111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.540270Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.540270Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:5b5d8eab31da4685d2b2deb15193ea9d60182cca26c987cc20a1222623cc17aa","observation_id":"07418574-947e-4f8b-b3a9-d721e9f249c2","resolution":{"observed_at":"2026-08-10T22:11:41.540270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-14T14:14:57.368189Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-10T22:11:41.543906Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.543906Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:02a37f7c08b2dbfc31e192b194563f3ccba6a9b06a7cde4a3014110f3f23fcca","observation_id":"58f70e33-90ee-4572-960c-c6778e8f34df","resolution":{"observed_at":"2026-08-10T22:11:41.543906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.102771Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":"0b2ef6b0-3a14-4a78-8eb0-2dd415b0699e","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.547763Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:f3609bd012d858fcaa12f2b15c9e7361634871622bf84c5d394fd99bebf8798b","observation_id":"5f1545d1-7996-4b07-938f-7eb1085a4a45","resolution":{"observed_at":"2026-08-10T22:11:42.109227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.092914Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"8cbacebc-6dcc-4d75-a3d0-48d6dba08d04","year":2020},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.551003Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:3a3393f22b165488098b062e51ced719ce3734427f6502e2d90893e2fc726fce","observation_id":"dd89a681-17e6-4141-ab50-670523bfe8cb","resolution":{"observed_at":"2026-08-10T22:11:42.096179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.078789Z","title":"Raft-3d: Scene flow using rigid- motion embeddings","venue":null,"work_id":"4198335f-1c73-4ce2-bd24-616dad90f88a","year":2021},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.553870Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:66e5669e0d6020536d0aaad694b368d1a1b8c9b87b68b8d7a15a8582aa48b0b4","observation_id":"3a8bf5a1-5937-416d-b097-ec3e86338e62","resolution":{"observed_at":"2026-08-10T22:11:42.086821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.056218Z","title":"Revealing occlusions with 4d neural fields","venue":null,"work_id":"4803bfe0-4def-4a38-ab63-09356a26f474","year":2022},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.557458Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:729261e173b60519abedb4973c303f7c9e2fd0c8d2bbd88e6cc9b0fabdc1bf9a","observation_id":"153890fe-b634-4051-b962-78d006d9b63b","resolution":{"observed_at":"2026-08-10T22:11:42.069309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.045408Z","title":"Generative camera dolly: Ex- treme monocular dynamic novel view synthesis","venue":null,"work_id":"12ca1c28-aa47-4103-b9b7-00a0fb9989bd","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.560651Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:4622651e07d9267cb79f96c6bec85b4b79d1960764dfefe3b9f8515b21d82be5","observation_id":"834e6a61-3a0b-4dab-9c36-390e7ec2e17a","resolution":{"observed_at":"2026-08-10T22:11:42.049232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.036258Z","title":"Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":"120e73a0-8c3a-47ed-98f2-d1df76b33d01","year":2025},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.565510Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:3ee030670a9c4e014db3bc732df558d7ac3e2532b168022f3b44f4b05ce67778","observation_id":"266901eb-a36c-44b3-a50d-dc3951fe92a5","resolution":{"observed_at":"2026-08-10T22:11:42.039394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07303","last_updated":"2024-10-11T16:17:53Z","snapshot_observed_at":"2026-08-12T22:27:00.163000Z","submitted_at":"2024-10-09T17:43:38Z","title":"Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07303","snapshot_observed_at":"2026-08-10T22:11:41.569412Z","title":"Rectified diffusion: Straightness is not your need in rectified flow.arXiv preprint arXiv:2410.07303,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.569412Z"},"links":{"cited_paper":"/paper/2410.07303","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:7098554ad9b92309ffd72cf74b5fa8bd95fc5cb9a2ee0078c0a90f72022a8b9c","observation_id":"7ce2b292-cd7d-4f79-90d1-6181c70c5f38","resolution":{"observed_at":"2026-08-10T22:11:41.569412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:42.026128Z","title":"Tracking everything everywhere all at once","venue":null,"work_id":"caa22b26-3fa9-478b-a5ae-1f8313cbc60f","year":2023},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.572682Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:5e27b6770736dc8fb7165259afa356dc6b1c8a31160e765cdefa0be3a3bd644d","observation_id":"6cec25e8-f5ed-4ebb-a63b-980b405c8433","resolution":{"observed_at":"2026-08-10T22:11:42.029047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.576056Z","title":"Shape of motion: 4d reconstruc- tion from a single video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.576056Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:e3d42a4180f27cadd108010e280e43cb83df99b86a400a9e08bf487ba6481f79","observation_id":"ce0ef4ff-e8a2-4e2b-b305-7358dfd5c7e3","resolution":{"observed_at":"2026-08-10T22:11:41.576056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.579654Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.579654Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:96565fc69cbd9349c0b4c41b3de8dcee9600f3288fe5ee4fce9a4a6adfe5dc4c","observation_id":"3fb7d36d-c685-4d19-99a1-55e6f02f8def","resolution":{"observed_at":"2026-08-10T22:11:41.579654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.997562Z","title":"4d gaussian splatting for real-time dynamic scene rendering","venue":null,"work_id":"255c2211-20c8-43a8-bc6c-c523fe2a095e","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.582479Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:f98267cafc9b97fe9a7dde01a0c18bf824809308d2220761d6d9592323b6e19f","observation_id":"c8acbfa7-6ba8-4303-8cfb-5d37b5ce385f","resolution":{"observed_at":"2026-08-10T22:11:42.002680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:41.962244Z","title":"Spatialtracker: Tracking any 2d pixels in 3d space","venue":null,"work_id":"ae291d7c-cd02-4396-9e69-7261740c60ac","year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.585232Z"},"links":{"citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:2c9eb6eeea51a8bb93f8fa7ed2ebfd3c2a1f66bef5218cb92245ba076d8e7cd1","observation_id":"dacc09c8-7ad7-4dbe-a09e-d3454698b441","resolution":{"observed_at":"2026-08-10T22:11:41.967076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-10T22:11:41.587901Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.587901Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:3ac984cf9e0fc0ac70a9beb2bc9ec3efafe908fd2648cacfb7cdb84438de23ed","observation_id":"50687d93-3ef8-402c-b74a-786c9607e442","resolution":{"observed_at":"2026-08-10T22:11:41.587901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T22:11:41.590629Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.590629Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:5187d4de40c8d16a7239273bfb864e6501ffc3352947452b62e47d3eb003726a","observation_id":"825e83bb-1ddd-42ed-9e57-3c2d5b132f56","resolution":{"observed_at":"2026-08-10T22:11:41.590629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-10T22:11:41.593206Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.593206Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:23d711176715044ad5887a7e574531197a51d774cf8b0eec1fc295c154ca048a","observation_id":"0d1f76a9-ce01-4f5b-a8a8-24dc3a5f3b53","resolution":{"observed_at":"2026-08-10T22:11:41.593206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-10T22:11:41.595985Z","title":"Monst3r: A simple approach for estimat- ing geometry in the presence of motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:11:41.595985Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2501.02690"},"observation_digest":"sha256:033fc911f92af438547aafbc2f4f90f9fa9d86c9357d8b83bae8cd65dc0c04ce","observation_id":"5a32b36e-a230-4beb-ab68-20e25f86a6ae","resolution":{"observed_at":"2026-08-10T22:11:41.595985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02690","last_updated":"2025-01-05T23:55:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T05:40:23.541978Z","submitted_at":"2025-01-05T23:55:33Z","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 13 inbound Pith citation observations for arXiv:2501.02690."}