{"as_of":"2026-08-04T12:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff36648e51443edf5cda111f309ed6fed2bd39b2b7c9b3641d819cd41c2a6be9","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:02:37.291472Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.04737/citation-record","integrity":"/paper/2606.04737/integrity","json":"/paper/2606.04737/citation-record.json","paper":"/paper/2606.04737"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:778424ff85eea3966e844f2eff6dcceb9348cf96fa612c58cc3c4725e046a5a2","observation_id":"6c8cdfd8-30a4-499f-be2e-b2c06d37e05a","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:2d8954fd08504886cc1445d8faa61678d326de74d1c2d7527cf64c6f3953299f","observation_id":"e6d49f01-3d53-4800-845b-e7e84d3a7517","resolution":{"observed_at":"2026-07-02T07:16:44.735890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:149dd0a8ad301057bb48c63e3506724e52008e10308c39dd008ccf7e9eaae7dc","observation_id":"a37a8ba2-69aa-4812-bd4d-4d8c06fb2b95","resolution":{"observed_at":"2026-07-02T07:16:44.714925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:d41ebe6ac35d0549b8dd2ac4a61109b2c8a291136089019dbf6ee3647896e5a8","observation_id":"75e79710-fe0e-4b5d-881f-4e6ac2b837eb","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Physgaussian: Physics-integrated 3d gaussians for generative dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:4da5f2bd1dce4dc5f4e42a9cad2d47b5d2e9868675a88847b5ab0e9206bf8914","observation_id":"c492fe98-8729-4ffe-b4f2-619c66b6732f","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Physgen3d: Crafting a miniature interactive world from a single image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:7a504399674b045249be3a4c52cd223b45c4afb7215c58017441d7f90c4216f5","observation_id":"bc18a93a-d20a-434a-8058-57f9e423e729","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Physdreamer: Physics-based interaction with 3d objects via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:8fe691f920c3d5576f9de99ba82a2aa46b3b06e6cecfe6dd9fc5bcb2007fefb5","observation_id":"578a201d-d542-490d-bd5a-cd526496d353","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.719370Z","title":"Won- derplay: Dynamic 3d scene generation from a single image and actions.arXiv preprint arXiv:2505.18151","venue":null,"work_id":"5fc82e3e-ec7c-4c0f-8e8e-245be42bc9cd","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:bd2c39633b9f4d32c9a3e61b9e0a967d56f8ded11bfc08b118270ab7989c3506","observation_id":"3f93f48d-8d65-4ac9-adb0-63353011c0ee","resolution":{"observed_at":"2026-07-02T07:16:44.721429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Phyt2v: Llm-guided iterative self-refinement for physics-grounded text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:950125464dacaf2d3f105fcf50af91ad5d0a9cba43d59a2dd87c9bf567921259","observation_id":"fcafcafb-c8b4-44f9-b137-c8149950f0c0","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:19:51.086118Z","title":"Phyrpr: Training-free physics- constrained video generation","venue":null,"work_id":"97d7b45f-54ed-4893-9139-0dae55bc279e","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:05ebfdab81693d8edb22cea701a60e84ac7b56140e3974ff655c3c0cbbccfd45","observation_id":"1174c2dd-b0bf-45d5-9449-be741b8504dc","resolution":{"observed_at":"2026-07-02T07:16:44.718056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Vlipp: Towards physically plausible video generation with vision and language informed physical prior","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:11b50cc2a46429d4652dcde5c22d6bdc0be4e6935786bb1856eea5a308ef4539","observation_id":"4e300e85-ed6d-4e35-a7ef-f053429e8a28","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:29:15.503264Z","title":"arXiv preprint arXiv:2601.10553 , year=","venue":null,"work_id":"49c8b7d1-54c8-4b8e-a2d1-2bcc3750e580","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:ed6cfb90bbbbff8799181ab3046034b75fa327209248940a1e7c635401abbce7","observation_id":"0ea5f57c-0e87-4add-8ecd-8046c70caf8c","resolution":{"observed_at":"2026-07-02T07:16:44.746011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08503","last_updated":"2026-05-18T19:22:00Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:48:46Z","title":"Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics","version":3},"cited_work":{"arxiv_id":"2604.08503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08503","snapshot_observed_at":"2026-07-04T15:49:58.003515Z","title":"Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics","venue":"cs.CV","work_id":"505e95d3-6092-4605-97a2-eb6701a6f0af","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2604.08503","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:9c780dc46e6c2437152ad40cca5e003a745db8e41e6388c89999292ed23a48f3","observation_id":"84158ce6-4bd9-4b12-b364-d533151b041e","resolution":{"observed_at":"2026-07-02T07:16:44.731305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08153","last_updated":"2025-03-11T08:10:03Z","snapshot_observed_at":"2026-07-06T20:50:27.661417Z","submitted_at":"2025-03-11T08:10:03Z","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2503.08153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.08153","snapshot_observed_at":"2026-07-04T13:19:51.064913Z","title":"Wisa: World simulator assistant for physics-aware text-to-video generation","venue":null,"work_id":"faa75e3b-50f4-44b5-bfe5-65f0dc911f7e","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2503.08153","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:e9de5d130c40b767031a41e0958194996ed1d523a531c9b5ed0f98178807f1b8","observation_id":"59e04899-31a3-45e5-afd2-48aabc9ede55","resolution":{"observed_at":"2026-07-02T07:16:44.712276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05564","last_updated":"2026-04-12T02:52:57Z","snapshot_observed_at":"2026-07-06T22:37:50.431948Z","submitted_at":"2025-12-05T09:39:26Z","title":"ProPhy: Progressive Physical Alignment for Dynamic World Simulation","version":2},"cited_work":{"arxiv_id":"2512.05564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05564","snapshot_observed_at":"2026-07-03T19:28:52.392697Z","title":"ProPhy: Progressive Physical Alignment for Dynamic World Simulation","venue":"cs.CV","work_id":"629e6cc8-d174-4ac8-865f-5f1ac17e6f4e","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2512.05564","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:1d1bc64faf0ec825294a37431a86f2151400fc2476b4017c7b99b05f7c543a72","observation_id":"acce5b92-5621-4f9b-aab2-ceed5d18439f","resolution":{"observed_at":"2026-07-02T07:16:44.742878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:16f8735d420bbcaf5dc6834e5ea4241f0ec1650b4e364251322f9020bd36ba00","observation_id":"515d0e1e-b80c-43ad-a427-4429e0863abf","resolution":{"observed_at":"2026-07-02T07:16:44.697405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:91054c7ba7d486120aa1dd14dd76e9f103f0502845cfccc2fe5164f2762e057f","observation_id":"996c34d2-6eb3-4f70-93e5-8d242d2fe4e4","resolution":{"observed_at":"2026-07-02T07:16:44.693308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:43.037042Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954","venue":null,"work_id":"86ba3b09-fc7d-4d26-acce-10677e0b5d69","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:d43d725250513c96fe94b51e36f1d74153ce06992d5d35c89871caab8a80d884","observation_id":"2f8e4cf2-7ba2-4137-93f3-ebe3b0288fa3","resolution":{"observed_at":"2026-07-02T07:16:44.716371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Flowvid: Taming imperfect optical flows for consistent video-to-video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:96c8a069f287265f088d2d2470e91482d5578f93af104c58de36d2a58c38ebc7","observation_id":"341bdeb6-3a50-42df-b4bc-43914e6af8b8","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-07-06T17:17:23.567885Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:a064bcb01623d8f762b514d3dc189013dec1947dc83b2a67178f578abbbc472b","observation_id":"fcc281d8-3e7e-4465-8d2d-8d5739501636","resolution":{"observed_at":"2026-07-02T07:16:44.709304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"V oyager: Long-range and world-consistent video diffusion for explorable 3d scene generation.ACM Transactions on Graphics (TOG), 44(6):1–15, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:38579f3ba14f49f187e3d52131ff7f57024daacaabf65f82b0c7639321ba0b7c","observation_id":"2b72ac52-2c62-47d1-ba21-42f63560ca64","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Make it move: controllable image-to-video generation with text descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:173985fbf386272df99b70a179ab70febe825a40066ae892634027aee6ee1d18","observation_id":"aa03d9a4-76b0-4a9d-bfe5-97a8790f43c4","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:84539991f7c6583d471a9342e30f04e018002ef7df4529e032d982117a28f4d4","observation_id":"15912955-fb1d-4ac3-8698-73be24cc9cab","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:18bb322b0dff56861eda9e45c3cd35dfa6c1065e251c948d98d52ee1297ad67c","observation_id":"53e81103-7fe3-464c-8b40-0a0132e37345","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-02T14:57:48.676109Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:8521ee2c4ad7d022c5ec105ca2b59a6f1973193b75cc0a1e6a91fba56bf00a09","observation_id":"06c1bef4-147b-49b8-9e6a-808991c3487e","resolution":{"observed_at":"2026-07-02T07:16:44.724614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:a33ef0d0574675ba920d74c5ed22c42f77bf701b7c5419156495afc400abed4a","observation_id":"ace5d16a-c636-40a1-98c1-e3b9d16b199d","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:c64edc68c177f3821fde71a2bda8321d9fd99c0d58e05dd0c00951ca5c5cec57","observation_id":"6d836230-207d-4764-b891-fe6c0fdcb2c9","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-07-06T18:57:05.603342Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:99d8d6bf2e8e6d6dc240bfed5266e6173a5102ae40e7e50e58247a73d8f6aa7e","observation_id":"0f8ec3eb-70b6-4884-b4e6-72129c28253c","resolution":{"observed_at":"2026-07-02T07:16:44.728428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Physgen: Rigid-body physics- grounded image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:790784360a9dfebeee0e5a253596f5880b0b726c4ce419381c8c1d11eff2b5ff","observation_id":"376cf0df-c9f4-40f2-b6ea-2cffaae4182b","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18982","last_updated":"2025-01-31T09:28:07Z","snapshot_observed_at":"2026-08-04T08:09:34.489327Z","submitted_at":"2025-01-31T09:28:07Z","title":"OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics Generation","version":1},"cited_work":{"arxiv_id":"2501.18982","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18982","snapshot_observed_at":"2026-07-03T00:57:30.546915Z","title":"Omniphysgs: 3d con- stitutive gaussians for general physics-based dynamics generation.arXiv preprint arXiv:2501.18982","venue":null,"work_id":"97b2be7b-cd3e-4bde-8626-e42d3ede91d5","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2501.18982","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:1fdf9ee24b7e9cb657e5ca873e7bfd2dd7b9e75d43a778e1c000981253ceadcf","observation_id":"af5f1c60-f345-4124-be75-6c91efb64aea","resolution":{"observed_at":"2026-07-02T07:16:44.732459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:51.725834Z","title":"What about gravity in video generation? post-training newton’s laws with verifiable rewards.arXiv preprint arXiv:2512.00425","venue":null,"work_id":"3b81a9f4-454d-49e9-921d-10bebe702406","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:ed03802b0836d6829f881b7de321d579c57417d5d47f4c9cc6158a7248c1bf74","observation_id":"c888c165-5863-468a-97c7-3202b06ec6f2","resolution":{"observed_at":"2026-07-02T07:16:44.739948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.355845Z","title":"Realwonder: Real-time physical action-conditioned video generation.arXiv preprint arXiv:2603.05449","venue":null,"work_id":"817e39ca-1acb-4170-b2c5-6d47674dfa6c","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:fc85d7b3592d8d36c8484b9540d1e85fdfd7911c4acf510e1ebfb0129e98f044","observation_id":"b6df8915-0cc5-4738-99db-4da69ecb2159","resolution":{"observed_at":"2026-07-02T07:16:44.786246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Neuma: Neural material adaptor for visual grounding of intrinsic dynamics.Advances in Neural Information Processing Systems, 37:65643–65669, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:885d544523816d15e5662b394a577d33a359524fc5f819938080ef5aac410dd4","observation_id":"d6041bd0-0888-4212-9ef5-6cf0f4826e00","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:19:51.155290Z","title":"Newtongen: Physics- consistent and controllable text-to-video generation via neu- ral newtonian dynamics.arXiv preprint arXiv:2509.21309","venue":null,"work_id":"581cc82c-3398-4ba2-ba9c-747d0864c252","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:4091a2ef82b96ba024d01adfb65dac96f76381f74ea176f7a44b38ddc8e3c86a","observation_id":"e58549fb-419a-4cdb-ae14-a923be6e0b10","resolution":{"observed_at":"2026-07-02T07:16:44.782866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Phys4dgen: Physics- compliant 4d generation with multi-material composition perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:ebf75bd2c4efb8ef7ff2ccc4db4396f03d268eb25b1ca7b6cd231974126bd6c3","observation_id":"3624d626-6bd8-400e-94fe-2e38a1ad3c20","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06408","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:49:58.013864Z","title":"Physical Simulator In-the-Loop Video Generation.arXiv preprint arXiv:2603.06408, March 2026","venue":null,"work_id":"68f6714f-aefa-43aa-8f58-4b37f12b6ab2","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:d4b1e2ded61c341e9638f9a3aa43bcb6977457022cf4bbf43e5ae4aa5ce81418","observation_id":"17764282-7f57-418c-aab6-828b6d25da46","resolution":{"observed_at":"2026-07-02T07:16:44.770748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Cp4d: Composi- tional physics-aware 4d scene generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:342c6d056e8d0e66f94362be91ac8caceb73e2bb63bf847e8f8c21c329e0efd6","observation_id":"8b4fca05-4421-4e91-827d-f6063e958814","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Learning physics-grounded 4d dynamics with neural gaussian force fields","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:7f98c28198b37773b313e82515760559d56fe387ac6032b5fded276fbc6217e4","observation_id":"9718caa9-7bde-4aac-a4b4-dc4141d63583","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.760393Z","title":"Chain of event-centric causal thought for physically plausible video generation","venue":null,"work_id":"32e6d5af-a6ee-4ad4-a090-3dfedc07f2b8","year":2026},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:3d0406ed54cbc7fb413ccb8b312d60ffcfdbd58d73d7e52d4634e2caa568a67d","observation_id":"0afcace6-7723-41b8-9d03-2a4cb2b6f8d9","resolution":{"observed_at":"2026-07-02T07:16:44.762404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:a9f5af78141bd3a3ebfd3f4d2eb999b53bf64cc587fcb40c9decc78fe7ba5bdb","observation_id":"82558469-6c06-4310-a168-d1df9ffc5073","resolution":{"observed_at":"2026-07-02T07:16:44.766781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-03T13:24:41.191940Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.24551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24551","snapshot_observed_at":"2026-07-04T13:19:51.054524Z","title":"Phygdpo: Physics-aware groupwise direct preference optimization for physically consistent text-to-video generation.arXiv preprint arXiv:2512.24551","venue":"cs.CV","work_id":"7d6a6560-0f08-4dda-bc91-b91a1435a72f","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2512.24551","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:edf37839f9c4e583a315a1983104ea165d0ba74a9f9ef1f50452f4962ed697a9","observation_id":"ce9a569b-0b0f-413c-b522-2944910075f5","resolution":{"observed_at":"2026-07-02T07:16:44.774380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:4a8a2afd96d280a0c636a705479e07a05b93a2ad81f8e46a39fbd595d1876d28","observation_id":"ad7f380a-e1dc-4704-bb38-8336d6d0ae05","resolution":{"observed_at":"2026-07-02T07:16:44.779670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-07-06T20:49:32.001630Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:f5024380c876a3b47bbd48f942832f3aadf7339ef2794b0cc9247faef41d9682","observation_id":"d8879029-c4bb-428d-9030-f6d732fd5ae2","resolution":{"observed_at":"2026-07-02T07:16:44.758956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:c8bf6fd134704f7f9be6bdd08e92de36414d1c4da988de5785e1b4f3c626e470","observation_id":"c0694b18-4a2d-4c96-bc2f-2fdf5d4a00b1","resolution":{"observed_at":"2026-07-02T07:16:44.749104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:ea88b86bf235aaa6e29bdf81b198cd10fa149219ffe3bbd8a05b7f325aa5f277","observation_id":"31caab3b-21bb-4594-b620-3b0f604174d2","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:5c9788e3ba2c0870890c6717faecc1f834aefcb50b5a318444b9e6cdda890d78","observation_id":"903eadfb-e9f9-4543-ae92-ae4f2956b0f9","resolution":{"observed_at":"2026-07-02T07:16:44.752562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:b5c7e4723be8a40ce7a5fdae91f16103018a20e3b3abb424f1642a1ed99065c7","observation_id":"7c0850f3-a87a-4f06-b37d-3a3ff7fe74f7","resolution":{"observed_at":"2026-07-02T07:16:44.755665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"refined_prompt","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:a9fd5ee697acfeeb66c6a305e9822b807328ba21e80c96235e3f4ef8d47a3777","observation_id":"3d1140e1-10f5-4990-9c67-69a48e63ae97","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"The residual ∂tdk −u k comes directly from the displacement–velocity relation ∂td=u","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:ceb64593ed5d876395e2ec39a5e0f02710fb8d957f9b948a5f849885b956668d","observation_id":"32e1e75e-48f0-4e06-b331-7bc7f9d6330b","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:78f4c7db612f35216527c6edfaba5930bd61413117093ed07b7d748e0fb4835f","observation_id":"7a489cbc-a0fe-49aa-a532-788b628e906a","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"The continuity residual ∂tρk +∇·(ρ kuk) is the conservative form of mass conservation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:5e390db7d2f1843d656931a39f2b3d746e739a525deda1e0da9035f2973ab50d","observation_id":"6875c27f-8b57-40e1-a436-ec67bdcbab7c","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"The continuity term again comes from ∂tρ+∇ ·(ρu) = 0","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:809a23d980d44db93ae4aee7031f143118fa256eadab131ed2a97018b3323965","observation_id":"e8194b72-dff0-4ce9-a978-4fc3cb8cd1d7","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:eb2d1231e1f3a3e5ba5db90c860eb8bdfe6479df8250e0c93ca569d57f05660a","observation_id":"4981661f-ca09-4e35-9be5-d1f8c731af80","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"The kinematic term ∂tdk −u k again enforces the relation between displacement and velocity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:24730947e9babf48272555d37017a2ecc47a1360addf24b636f2bf4567bbc014","observation_id":"9386e8fb-3106-4a99-9ce6-f7b3ad2735b2","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"The term ∂tTk +∇·(u k ¯Tk)− κ∆Tk combines temporal storage, conservative advection, and diffusion, while ∇Tk limits isolated temperature spikes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:64c5065836cd8092be3a953f36e76f9840ac1362abbe44042f8e3499e24c1b83","observation_id":"ba5c80b1-edab-4bf5-b151-3378e8df5b76","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:02:37.291472Z","title":"w/o Expert Routing","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:5662e01116995f999fae58f53c5fbf1edbca428b24da5b5b5021de67dcd36744","observation_id":"0468624c-c070-435b-8982-4e7aa0c765be","resolution":{"observed_at":"2026-06-28T07:02:37.291472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2606.04737."}