{"as_of":"2026-08-05T15:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8267067ef9649d59dd852d1c38b9499b966c1f17b63e9f4b65f5e2446e73b23a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:35:06.650603Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:59:58.033217Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:515ba3a11142d75712a2e1112d5d0ad968527cd1498267b7da4e660e24e0488b","observation_id":"b5a4a27d-6d6a-47e5-9999-9b24a1c0b084","resolution":{"observed_at":"2026-05-19T05:17:06.569867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2510.04978","last_updated":"2026-04-30T05:27:37Z","snapshot_observed_at":"2026-08-03T00:20:05.639737Z","submitted_at":"2025-10-06T16:16:03Z","title":"Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T09:56:36.716680Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2510.04978"},"observation_digest":"sha256:ef1e2b5300ff29e06f1a59d41729e4b98f16d054d211ba4783e02ca7d5d63927","observation_id":"b39a40a2-396c-4989-9eeb-1d6698f25ca4","resolution":{"observed_at":"2026-05-18T10:01:13.996334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:07e307a0f1e288acce664323e99a1d7fd36bf820648fc3b88790e4853c665cdc","observation_id":"347d065b-bf02-47cf-93e4-dc32cde8e675","resolution":{"observed_at":"2026-05-21T18:00:27.218289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-08-03T10:35:06.650603Z","title":"VideoREPA: Learning physics for video gen- eration through relational alignment with foundation models.arXiv preprint arXiv:2505.23656, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09881","last_updated":"2026-07-09T22:49:12Z","snapshot_observed_at":"2026-08-03T12:37:49.883319Z","submitted_at":"2026-01-14T21:30:03Z","title":"Transition Matching Distillation for Fast Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T10:35:06.650603Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2601.09881"},"observation_digest":"sha256:e402fdb8d2bf70e9943657ded737ab0f0e3741e804eea1e4658e0d1b0067a059","observation_id":"69637c36-5420-458d-a69b-d39cf17d89a6","resolution":{"observed_at":"2026-08-03T10:35:06.650603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-08-03T01:20:05.776188Z","title":"VideoREPA: Learning physics for video generation through relational alignment with foundation models.arXiv preprint arXiv:2505.23656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-03T01:20:03.338758Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.776188Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:dbd43ebdd1579b9824672eb5717924b4e5a427fefad55bea383c48902fe93294","observation_id":"fea40679-2fe9-42ba-a4d7-980a8fee9702","resolution":{"observed_at":"2026-08-03T01:20:05.776188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-13T22:08:47.493022Z","title":"Videorepa: Learning physics for video generation through relational alignment with foundation models.arXiv preprint arXiv:2505.23656, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.19226","last_updated":"2026-07-02T17:59:52Z","snapshot_observed_at":"2026-07-13T22:08:05.549858Z","submitted_at":"2026-03-19T17:59:45Z","title":"Under One Sun: Multi-Object Generative Perception of Materials and Illumination","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T22:08:47.493022Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2603.19226"},"observation_digest":"sha256:d63ba6598e76db8fcb02edaee9d3fd0cb50116f0d5c108b59f1f3095af145f76","observation_id":"f5a7bc71-0409-43f1-ab5f-f5fe57d6eed1","resolution":{"observed_at":"2026-07-13T22:08:47.493022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:89a38cdea6554b293a99f1615d4641310100177aa379126d93dd80c69d757623","observation_id":"b8350745-ef14-44b6-b0c1-2fb281f9fa2e","resolution":{"observed_at":"2026-05-10T08:12:26.004914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:51:12.604102Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:770acc3e2b38d232fd0a38648e088bb78662109b9e0bdab5ed5ddf7d37f92509","observation_id":"ddfce7a8-fb29-4369-8fe4-64e89c4cea8f","resolution":{"observed_at":"2026-05-11T09:46:02.916958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:2414c6bbd1480eb35fd17f70bf97ca8ab51fa58bcff203435aabb9af8a9e0cbe","observation_id":"cfba5c5f-3f70-4db3-a916-26d354c6e17d","resolution":{"observed_at":"2026-07-02T23:57:27.925208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-08-02T01:30:37.148519Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:21:52.861714Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:4d6f08a06c5db66befdfd0452a8f5ec36413bf1343e7ff9d24838bb9bbfc9730","observation_id":"d844438a-eb74-4af3-bbda-a7a2a3b2ab97","resolution":{"observed_at":"2026-05-11T02:25:54.965159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.07800","last_updated":"2026-06-09T17:19:58Z","snapshot_observed_at":"2026-08-02T01:30:37.148519Z","submitted_at":"2026-05-08T14:36:32Z","title":"SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T23:13:31.195562Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.07800"},"observation_digest":"sha256:66c31db78c5f60dbf9e0a9c2c72d4651f7ae0c7ded6fee2e56d4ca98229a80e2","observation_id":"bef583c8-5140-4de0-8c28-eb5ae6021bc8","resolution":{"observed_at":"2026-06-30T23:15:07.975899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T11:40:14.358108Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.18324"},"observation_digest":"sha256:8979024a6c524be9c62dcee71b0946978c051a078cf545d944d764f968826294","observation_id":"dee2aa1f-2305-4f4a-bc05-e1b9005fd7ac","resolution":{"observed_at":"2026-05-20T11:43:15.208972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-02T07:31:08.555715Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:1dd1cb8e62db58d469f094469a3b4842c08a176854f7c305a5d5f7109cc47f1b","observation_id":"cf386c95-a14b-4de8-8545-7dfc4da47dfc","resolution":{"observed_at":"2026-05-20T11:08:13.552484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.20808","last_updated":"2026-05-20T06:59:12Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T06:59:12Z","title":"Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T05:26:29.331382Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.20808"},"observation_digest":"sha256:6ecd79b6332357a850c834a1ac58bf6cde9754c18dc0acf3a22357d3218357b5","observation_id":"e4378f01-936c-4241-8c9f-b3310203a143","resolution":{"observed_at":"2026-05-21T05:29:39.647375Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-05T15:30:53.696833Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-25T05:34:03.684055Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:0e0c0257a83e547c820e6b6040f9b1f97aa0b3b14b068898d3481487ceda2023","observation_id":"5a6330e7-96b9-40a6-b95f-eeea49b81e39","resolution":{"observed_at":"2026-05-25T05:36:39.673333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.22882","last_updated":"2026-08-03T23:32:29Z","snapshot_observed_at":"2026-08-05T15:30:53.696833Z","submitted_at":"2026-05-20T21:36:44Z","title":"GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T16:45:15.955954Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.22882"},"observation_digest":"sha256:fe935212c019eedda8df4c66040e1ce9b954c7aadc90ff27535babbcabd01376","observation_id":"06816102-79a0-4900-aef0-2137740776ec","resolution":{"observed_at":"2026-06-30T16:54:59.244185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2605.24962","last_updated":"2026-05-24T09:28:05Z","snapshot_observed_at":"2026-08-02T19:14:30.533296Z","submitted_at":"2026-05-24T09:28:05Z","title":"Tempered Self-Similarity Alignment for Physically Plausible Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T11:39:06.597513Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2605.24962"},"observation_digest":"sha256:869bfb0bb4288c9ed79ea0ec4fd7c5c12de0c3b86416d143ca2be6b425d675be","observation_id":"69bacd6a-cb6c-4e45-b530-b31d7f79b389","resolution":{"observed_at":"2026-06-30T11:44:38.419321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:5428aeaed91d60e93d5ff52219aa68be6830eb95b698ef13dfeb276ff529e55e","observation_id":"8a7e44a6-7118-4dbf-aefb-16e6097fecee","resolution":{"observed_at":"2026-07-01T22:26:17.292794Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:a454a1c11189a2c33bd99fb341b58f30ddfab569a24df5581ca55399cb462864","observation_id":"41590636-0f5c-4401-8ca2-229780b66fb2","resolution":{"observed_at":"2026-06-30T10:44:36.814378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:a546316a0d23f962669a2c2794ed436c8bf43e2100183aee13b4ed3327f4dbb3","observation_id":"82558469-6c06-4310-a168-d1df9ffc5073","resolution":{"observed_at":"2026-07-02T07:16:44.766781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:46d001a7b6fb7429391926f31bc7e740c09e38dd4eee340c592381fddf2671ec","observation_id":"fa4e91e3-0bc4-46b1-9ce4-87de4c77cc3e","resolution":{"observed_at":"2026-07-03T20:48:55.711321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:38ece817e84f0ad9bbb68dde311c2896ceacb559fd4b5237609e69efc9ce5f9e","observation_id":"a3d93cff-ae59-400c-9522-85b5c75c3b6a","resolution":{"observed_at":"2026-07-04T16:59:58.035148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.26916","last_updated":"2026-06-25T11:53:27Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T11:53:27Z","title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:53.011837Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.26916"},"observation_digest":"sha256:9828131978cfea953acef1c65a76f334eb1cd4a3c76158666c83eb290202510b","observation_id":"0cf101dc-2c4b-4fee-ad47-32c22d7f180f","resolution":{"observed_at":"2026-07-04T13:19:51.068810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.28128","last_updated":"2026-06-26T14:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-26T14:30:18Z","title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T04:34:38.286863Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.28128"},"observation_digest":"sha256:c28692405289240154dfaf38e4bf9d518f883649c10ed8475ba855524d4a7f6d","observation_id":"41115953-6c40-4c0f-b9ca-6988c3897b11","resolution":{"observed_at":"2026-06-29T20:03:56.910145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2505.23656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-04T12:36:41.280283Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:573727b97901efa20a5d91b66a608f7a0aba6f8d63e7738ff463abf15ed71e6d","observation_id":"9af6b0f9-eacb-41c7-a90e-2ac286a2674c","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Limitations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:3c064eb5971941a37ee1aabab6b53332efb18a6b4dd2cfacfc866083ac407c1a","observation_id":"6d6d83d4-61b0-4f0e-a988-27a6bc4da859","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-08-02T02:51:47.212234Z","title":"Videorepa: Learning physics for video generation through relational alignment with foundation models.arXiv preprint arXiv:2505.23656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14088","last_updated":"2026-07-15T17:59:23Z","snapshot_observed_at":"2026-08-03T01:46:55.792689Z","submitted_at":"2026-07-15T17:59:23Z","title":"VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:51:47.212234Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2607.14088"},"observation_digest":"sha256:23b448cd3a637c983a998d6df7b975922cf4c38bda118a8d1a6d84ab933ede97","observation_id":"9b091439-78e3-4a07-94a1-48dbf571c7d3","resolution":{"observed_at":"2026-08-02T02:51:47.212234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-08-01T05:27:20.293209Z","title":"Vide- orepa: Learning physics for video generation through re- lational alignment with foundation models.arXiv preprint arXiv:2505.23656, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-03T05:45:07.278974Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:20.293209Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:c317a66d34f1cf0ad1c91c7d83a76a7bd1b8da3d9ea64867081224829b3a2093","observation_id":"52c22c41-0074-482b-bf14-43e8adf5a7f5","resolution":{"observed_at":"2026-08-01T05:27:20.293209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23656/citation-record","integrity":"/paper/2505.23656/integrity","json":"/paper/2505.23656/citation-record.json","paper":"/paper/2505.23656"},"outbound":[],"paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2505.23656."}