{"as_of":"2026-08-07T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7edf5232f4ea2efac08b617fd3d88192d177bd94ec2347db9cd1f7748a2d2280","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:27:03.245735Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15824/citation-record","integrity":"/paper/2507.15824/integrity","json":"/paper/2507.15824/citation-record.json","paper":"/paper/2507.15824"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T15:27:00.219696Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.219696Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:1d475aa7e3a1e7ab7886b5e1df82049788e450db89014fc5e387f9acb62ce9cd","observation_id":"dd05d835-036a-4d73-a28f-484ef0c0855e","resolution":{"observed_at":"2026-08-06T15:27:00.219696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-07-06T20:54:45.985432Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-08-06T15:27:00.284729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.284729Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:2901f3682f2dfeb93d399a8a7b82a39514ad3337b03cfa37d5b440c7126f838c","observation_id":"6d342f1d-ad5c-427e-b5bd-651c97f9a05e","resolution":{"observed_at":"2026-08-06T15:27:00.284729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-06T15:27:00.383675Z","title":"Bansal, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.383675Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:c7b5cd2b198de68f1f58661ed7ff3f8c7757894abc99cac56f9db427d6003be2","observation_id":"ab5d0084-29aa-49f1-8b60-e22e7e23eb9f","resolution":{"observed_at":"2026-08-06T15:27:00.383675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-04T19:41:18.206234Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-08-06T15:27:00.441134Z","title":"Bansal, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.441134Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:1d97867b3c6e0fb60e9dc3226a0346354d30499deaf117bd84575f25e7b7d97a","observation_id":"5408ffb6-a523-4df4-b901-5475e57ec79a","resolution":{"observed_at":"2026-08-06T15:27:00.441134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-07-06T08:40:06.727297Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-06T15:27:00.511632Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.511632Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:ef7775944532c9b1c89bde13e8fa064af1044a6bf4c9636268c541365da867f3","observation_id":"0cd747e2-bf7b-4097-86cf-cb7ba2c3b498","resolution":{"observed_at":"2026-08-06T15:27:00.511632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.184215Z","title":null,"venue":null,"work_id":"e51d1e0f-a724-4007-a10b-7d3184935402","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.600323Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:955f4221706d43cea5dc85c63026babcce188ab351b9c24b74e16a3813c0a478","observation_id":"68e9ff5b-fc7e-4e3a-ab78-bdd91f96d9c4","resolution":{"observed_at":"2026-08-06T15:27:04.190158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.163667Z","title":null,"venue":null,"work_id":"e1f193a8-e44b-4650-ad2f-d8ce47f1ca5e","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.668523Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:4cf609628eeb69087e46cade971302d767e1a4cd63a9626ea4b31f3d84147b90","observation_id":"06aaccd1-4251-4057-a12d-a536cd6bce6d","resolution":{"observed_at":"2026-08-06T15:27:04.168628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.148443Z","title":null,"venue":null,"work_id":"5487707b-637a-433a-b0d4-deb737966491","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.772417Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:67148a7b089fbace57b71fe6af8c3ce53d2a3e00df942368887ba33ffbb856b1","observation_id":"443a8733-255a-4e0c-a0c6-9a7208b88e23","resolution":{"observed_at":"2026-08-06T15:27:04.152771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.132227Z","title":"Gemini 2.5 Pro","venue":null,"work_id":"71a8cd73-d833-419d-9379-35addb145e81","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.825849Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:b55d965090ae2e7d8bf4e216887dd9b787f49a022578ed74e2740213bcb2dca4","observation_id":"203b6b81-9be3-4821-981a-47ddeeb5ec0b","resolution":{"observed_at":"2026-08-06T15:27:04.137144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.108561Z","title":"Gemini 2.5 Flash","venue":null,"work_id":"7bc41575-6a96-40c8-bd45-78104ddc25c6","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.897645Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:8abb8f3a27bfa333c9513648f59b4ce6ccc143970419479c92b1a8e4baf4c84b","observation_id":"b1f2d662-8e71-42d6-872c-e817f9b13f2b","resolution":{"observed_at":"2026-08-06T15:27:04.116230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.093353Z","title":null,"venue":null,"work_id":"a6eafbc2-58fb-4d8d-8af8-b621b146617b","year":null},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:00.996067Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:c1cb3e64f0a180dbe4e4676445f97c4eeb9ba51941ecbe8d5e9ba85800cb0d79","observation_id":"49e730d7-c9ba-457e-b563-20e622c9018f","resolution":{"observed_at":"2026-08-06T15:27:04.097902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T15:27:01.156060Z","title":"HaCohen, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.156060Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:42db1c36cb1ef420b12ecb761cc2b57df6ea7f57f54b036fa509b570b25cef41","observation_id":"e9be4478-8ace-4043-8239-d84d8ea79e36","resolution":{"observed_at":"2026-08-06T15:27:01.156060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-07-06T20:34:58.053187Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07825","snapshot_observed_at":"2026-08-06T15:27:01.234367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.234367Z"},"links":{"cited_paper":"/paper/2502.07825","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:2db48b145661035ad83d4e6898af8de1788fb4b325df819a2dbf7b0085e38038","observation_id":"a72f13bd-15f5-4954-abc2-fc2f681ef209","resolution":{"observed_at":"2026-08-06T15:27:01.234367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.059476Z","title":"Hessel, A","venue":null,"work_id":"44f1c900-efb5-4670-a9a6-4343fa1da275","year":2021},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.325311Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:1128e21f1e1e3f84e8e5c3d56fde642e586b11a4d2a03fc6172998f2cf2564b6","observation_id":"af6b60e2-c63c-45b3-8c6b-cdf8d396e8b1","resolution":{"observed_at":"2026-08-06T15:27:04.064421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-06T15:27:01.391505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.391505Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:0fa4b974403571373c1057cc3044860bb649b3ffaf8830a1639dd576f0dc5d16","observation_id":"6ec4b984-e348-489b-be63-be1a310b892a","resolution":{"observed_at":"2026-08-06T15:27:01.391505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:01.441313Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.441313Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:4e2aec6a3fd7bee5802b8ec304e1ece249302ecadbafcb6a51ff0b7c98a3e24a","observation_id":"4efc76c7-0511-40a7-895d-2155be20621c","resolution":{"observed_at":"2026-08-06T15:27:01.441313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.044872Z","title":"Huang, H","venue":null,"work_id":"4824e21f-f0d4-45d4-98b9-a3c6cff22039","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.495108Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:a8f7e00c3c58d862f08a7274da5a134cafeacdfca4b0a5eb1f7c7635b13b604f","observation_id":"746c52b3-4100-4d68-a5ad-ffe926aa39fd","resolution":{"observed_at":"2026-08-06T15:27:04.049667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.026088Z","title":"Huang, Y","venue":null,"work_id":"a343fc5d-59c1-43a6-bd0f-f4aec3f87754","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.576906Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:ecdb3cd5f252d5e4dcc300827f8c84b67e4ce30fc39b9c54cd0a4199f642ef6e","observation_id":"d3e8b807-4e35-4a51-9bb8-da81b28bb603","resolution":{"observed_at":"2026-08-06T15:27:04.032429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T15:27:01.639928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.639928Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:3a6bba5bb9355a06333d64c149c981470c751a75482359c9705470b2d2c899b6","observation_id":"fa7dc48a-ed60-4b45-a638-f94f94f50c2b","resolution":{"observed_at":"2026-08-06T15:27:01.639928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.004443Z","title":null,"venue":null,"work_id":"1fd1404d-6e07-498b-aeb9-a5099c47a2f7","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.712330Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:979716fecd70317445dc7efd997ec17b5e41c36c17e81410fe580020cc9a98c2","observation_id":"06750cd7-951f-4862-acd7-51c0aaeca1bc","resolution":{"observed_at":"2026-08-06T15:27:04.009403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.980447Z","title":null,"venue":null,"work_id":"8a40ec28-25ab-4542-91e2-2e0d839904f9","year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.801312Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:98520f6dbc4048850af4aff331026c0897eafbe1a14b00d18f9d8b3aae709e63","observation_id":"8697019d-a8fc-476f-adc8-4201986812b1","resolution":{"observed_at":"2026-08-06T15:27:03.986899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.960671Z","title":null,"venue":null,"work_id":"c8f8b04a-6549-4cc0-8db1-9d7cb48f90dd","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.865776Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:f53851554fb7d541eb5344f291acdea1362941abeaa849774212d8de654b7dec","observation_id":"2dac2889-bf4f-47b0-b914-8a8391058d78","resolution":{"observed_at":"2026-08-06T15:27:03.967150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-06T15:27:01.918575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.918575Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:8b6f029cfd7a79dbaff13fbdaaf39e2969efc38b99fb0491b91ff292a0f29935","observation_id":"78df88ff-b6a1-4c01-b8c2-34c05b4f63a7","resolution":{"observed_at":"2026-08-06T15:27:01.918575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-06T15:27:01.977216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.977216Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:199473e1b90eed2f359093484910400e5e3bcd7e53059235b66cf1e40cb8d6b5","observation_id":"27178bec-ac2b-4eb9-81d7-9bd31f9552fe","resolution":{"observed_at":"2026-08-06T15:27:01.977216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-06T15:27:02.052076Z","title":"Motamed, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.052076Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:12087d3208f758feec9fa34307705841ccb64bbc9f1dc5c1b0e043fc378011b0","observation_id":"c9861670-97bb-4563-b7f1-469724aed6ba","resolution":{"observed_at":"2026-08-06T15:27:02.052076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.944344Z","title":"Sora: Generating videos from text, 2025","venue":null,"work_id":"e48cc3c0-3d63-46ad-9637-5fd3583de321","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.115473Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:135451314524ed27a22298fe681576ba4329e34c9c8445bc11cfb0712b29f2c0","observation_id":"dd65b5ba-7e32-48b4-8fda-d7d3f0d98802","resolution":{"observed_at":"2026-08-06T15:27:03.949098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.924895Z","title":"Gen-3 Alpha","venue":null,"work_id":"47d84713-720e-46d3-8126-bf59331c007c","year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.234677Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:f0c51e67eb4d03dc1c86189f86897218e2b032eca2d37752f4310d00386ea154","observation_id":"83d1dd11-8178-4bb1-b895-5aff8986a35f","resolution":{"observed_at":"2026-08-06T15:27:03.931477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.905906Z","title":"Salimans, I","venue":null,"work_id":"e8b95e4b-7d48-49a0-8be2-9704f03b7b18","year":2016},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.385510Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:77ddb84ac7f6e5a554bb330370d81c934db0673c9020bf21d8a64107bf748c61","observation_id":"2ca34fe6-b039-42c7-8c55-7e16e86dfc42","resolution":{"observed_at":"2026-08-06T15:27:03.911290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.888623Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":"9d8b3cad-b8f9-481c-8cf6-928f77972f37","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.553838Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:c526119be9a7d84997dcdf2a746d9b997ca197a9d0dfea04d9536a6a07b54276","observation_id":"bc2a468d-5cd6-4fd3-bffa-f615d734e8e7","resolution":{"observed_at":"2026-08-06T15:27:03.893828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T15:27:02.698103Z","title":"Unterthiner, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.698103Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:40d07e47621f291eb2aeb95f8647ca1a94f392045477d544a581b5adaea676f8","observation_id":"b4ea5221-cc9e-4341-8817-fc93eac75d0a","resolution":{"observed_at":"2026-08-06T15:27:02.698103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T15:27:02.864867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.864867Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:b53c8e55e422412c1df0f4a4e325cc39ee0c80426de564b6411fd0b8eb00970b","observation_id":"6f08ae1b-8495-4218-9ab9-857cabf24641","resolution":{"observed_at":"2026-08-06T15:27:02.864867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T15:27:02.986657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.986657Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:ad6f5242583caf0abc127e77604f4f737128336777c68dbf5d6a641915b1af68","observation_id":"fe0eb035-5071-4400-b47a-e6a17f6bbff8","resolution":{"observed_at":"2026-08-06T15:27:02.986657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.870526Z","title":null,"venue":null,"work_id":"96c04f3a-4aaa-42aa-a83f-adbee2c0a5f4","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.109495Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:280bcd2cbd935dac64d5d3228d23a8c4d7b9907bb62a903ad84c69d06979d1c1","observation_id":"b6464209-3ee2-44bb-89d8-af07f222587f","resolution":{"observed_at":"2026-08-06T15:27:03.876651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.851788Z","title":null,"venue":null,"work_id":"cd2d5a75-61cb-4fdb-acfc-d97a98672f09","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.230414Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:29ccb24d3b0a2871b5f5c114bb1143038798b5331c4a7d0b81477f93e57873f9","observation_id":"8b847a99-dda7-4fbd-a632-715a95042b47","resolution":{"observed_at":"2026-08-06T15:27:03.857513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-07-06T14:28:56.301970Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-06T15:27:03.235158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.235158Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:dec8a050648f0c7da1545f5d77b147c0a1cbecaeece4e728b276afbe416d585f","observation_id":"144296a1-b1b6-42ab-a870-9fc2f61ec084","resolution":{"observed_at":"2026-08-06T15:27:03.235158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-06T15:27:03.240621Z","title":"Zheng, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.240621Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:bbb7802b8651ef2a80374d56362a5087e825f0910df5e72761cad0adf9db95e7","observation_id":"7b25baba-56db-4676-8722-d9ea2ea759f3","resolution":{"observed_at":"2026-08-06T15:27:03.240621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:03.828167Z","title":"are” rather than what agents can “do","venue":null,"work_id":"5d7fb6a1-8d56-4c2e-b71b-6ce101a5af27","year":2023},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:03.245735Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:8e8816fe19a83b985434b3fa4c1bf8340fe0f5bfc1c699b39a8420dcb16499b0","observation_id":"b82d2d0f-ccd5-4d98-a987-6b562a6e5018","resolution":{"observed_at":"2026-08-06T15:27:03.834877Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:27:04.076634Z","title":null,"venue":null,"work_id":"ef39cbae-3c74-44e9-af8a-bc111385f175","year":2025},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:01.065176Z"},"links":{"citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:445d21a62c818991371dc2b0f69d9b75059f8e9544516c93ccddbe7d8976e3b9","observation_id":"9e4b52cf-bc2b-4562-9aac-05d737f56107","resolution":{"observed_at":"2026-08-06T15:27:04.082066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:48:22.902763Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2507.15824."}