{"as_of":"2026-08-19T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66b2b13cd873a156bdd1a003ab9d26c1133f49c2751f2a4d16d8986770960413","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:39:22.070629Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.07061/citation-record","integrity":"/paper/2605.07061/integrity","json":"/paper/2605.07061/citation-record.json","paper":"/paper/2605.07061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:fadd2c28976e958b62188f8f38467ec8e0bb0b3d76c93b248c4d982f230298e9","observation_id":"5a8a2620-d35a-4f03-b086-7b814fd71ea4","resolution":{"observed_at":"2026-06-30T23:45:08.260783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-08-16T12:54:37.000371Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:e23077e2fcef7b7835534783d971129eb61d1fb09e80c39b2146ab7c0f60e826","observation_id":"c0795d41-239c-494c-919d-5e8ec55ae934","resolution":{"observed_at":"2026-06-30T23:45:08.231096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-16T12:51:43.372607Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:c7dcbcf2229f1306a6c53bfe133b950eed23db8f08c2d35e63e3f9d47bfc5d67","observation_id":"68ca9a9f-28a4-45f6-97c7-000e535ba148","resolution":{"observed_at":"2026-06-30T23:45:08.203083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.290790Z","title":"Video generation models as world simulators","venue":null,"work_id":"6d25dc8f-02d4-4aab-84e4-1d87bf3567a6","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:c7fe4656ccd931b9b0c0f6d51df45e16475fa25bdb57acab3e715df422c5fbc9","observation_id":"70f089c7-d8d9-45fc-871e-9cc4bfdee1b2","resolution":{"observed_at":"2026-07-07T10:33:40.268019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/10494820.2024.2414152","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie: Generative interactive environments","venue":"Interactive Learning Environments","work_id":"6c633c28-756b-4f8a-b31e-d5ac37197f04","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:5866e71704a004978d22c2e6dbcd87944508ea86c74f50d248c0559cc0e84e17","observation_id":"76e56aab-8d82-414a-b7e8-908829fa1ca6","resolution":{"observed_at":"2026-07-07T10:33:40.269905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:a2bd4582cc17ce9f18fa431dc97288d565264ed60771c001474e0bbe032352e0","observation_id":"a69173e7-7a2c-468a-9dcb-74d5437933cb","resolution":{"observed_at":"2026-06-30T23:45:08.236205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.270469Z","title":"Soundspaces 2.0: A simulation platform for visual-acoustic learning.Advances in Neural Information Processing Systems, 35:8896– 8911","venue":null,"work_id":"caa69eb8-28a6-4f24-9b4c-0c14d009ae7f","year":2022},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:b999d697a2c9a32beb8345dd0348d1163966e16805d64c3d3c8052d4baa6f104","observation_id":"b2617e39-eb0d-4709-b816-ddbac5719cac","resolution":{"observed_at":"2026-07-07T10:33:40.271754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-17T15:58:43.868299Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:cbe32a80363da1a73a194a5ff74049d6a054d189dc95b816f90bcbb42ae4dd60","observation_id":"162511d4-657a-4d71-8e94-51887078ef76","resolution":{"observed_at":"2026-06-30T23:45:08.223574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:37:29.792063Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":"b20b430c-75db-48ea-9a8d-4bbdeb416467","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:86c044fac5e09569ba95ceecbd0d7a4e569af1d42f48bb7f8b567908b241241b","observation_id":"0eb73f90-8817-4f51-b983-38ff60e71dbb","resolution":{"observed_at":"2026-06-30T23:45:08.241509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:bcf959fa1838de5308c4f261e8f925b90c7fe980a84c37b7dd618e102e2bca4c","observation_id":"75847fe0-e924-4df2-ac3d-91fb842a887a","resolution":{"observed_at":"2026-06-30T23:45:08.215209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.265192Z","title":"Introducing Veo 3.1 and advanced capa- bilities in Flow","venue":null,"work_id":"f44a13df-f9f2-436f-a19a-26c9357a6c1b","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:b1edba952308db9011291642d9faf21444d4b183b08473aa01608844c066af31","observation_id":"385760c1-0697-4437-8535-80c3b003ef5c","resolution":{"observed_at":"2026-07-07T10:33:40.266378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.272322Z","title":"Technical details inherited from the Veo 3 Tech Re- port,https://storage.googleapis.com/deepmind-media/veo/Veo-3-Tech-Report","venue":null,"work_id":"2f0fa94c-94b5-42c2-871e-60bfecf9e225","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:5684350df6a5c89126780d1f09c680795e0e5cf47d162f5ccd97bd63919aa2cd","observation_id":"19520228-7172-4c56-929d-2f27853d27b7","resolution":{"observed_at":"2026-07-07T10:33:40.273514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.257749Z","title":"Look, listen, and act: Towards audio-visual embodied navigation","venue":null,"work_id":"7e4089a1-a026-4652-adfc-4994a93cac70","year":2020},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:737e9fcab80efd0d257a017e1e31f4fdaefe1b21fbf57f5573bffbf93658f564","observation_id":"dddbdb33-a9e4-4c17-bce5-d2c8fef8bbde","resolution":{"observed_at":"2026-07-07T10:33:40.259561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13428","last_updated":"2026-05-26T08:34:24Z","snapshot_observed_at":"2026-08-06T16:22:35.916708Z","submitted_at":"2025-07-17T17:54:09Z","title":"\"PhyWorldBench\": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models","version":3},"cited_work":{"arxiv_id":"2507.13428","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.13428","snapshot_observed_at":"2026-07-08T07:14:45.185207Z","title":"InThe Thirteenth International Conference on Learning Representations","venue":"cs.CV","work_id":"7c164e09-5340-4f56-b63d-0e810f24f851","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2507.13428","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f45f406bd45a6f79c161078b315b8187f225fa774be0767ee66fd4857bfb1ff4","observation_id":"1ca743af-1dfe-440b-bb86-c2ecf398f61f","resolution":{"observed_at":"2026-06-30T23:45:08.238608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-08-16T04:42:37.134626Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2505.00337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-04T13:59:51.792842Z","title":"T 2 V P hys B ench: A first-principles benchmark for physical consistency in text-to-video generation","venue":null,"work_id":"8e0819a9-997f-40ad-9d64-220808cd9d4c","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:728ddf975b87e19860e45dfdab1d64c44ebd508618a905115f3ac586dcfb8bce","observation_id":"9cbc7b9f-9d62-433f-81d8-56ab5f6b919b","resolution":{"observed_at":"2026-06-30T23:45:08.258303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:eea55b692265b0d0602ba9f1b301d70b3adb008caecdb95230fda2bd2704a10d","observation_id":"5975024c-9ed4-454a-b844-4ca3c6bf49ab","resolution":{"observed_at":"2026-06-30T23:45:08.209925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.825321Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":"a95a4387-dcbf-44b4-b3ed-2111b55ee80f","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:b15b115fa36de660e54e660483b568050c3cc3686c1d05e54b90a2a7828ab754","observation_id":"03d9c9c7-4aa9-46ad-8eea-6c77da3d07b2","resolution":{"observed_at":"2026-07-07T10:33:40.257251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.260150Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"141a869e-b835-4f09-ba60-a92e0c752882","year":2021},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:72442508faded48cbc6b5f9f96283f3021833053bee64109e1319a47dbfd2451","observation_id":"d4e9e043-088a-44f1-af6c-7cb6fa3e6914","resolution":{"observed_at":"2026-07-07T10:33:40.261363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-18T03:03:12.839060Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:aa19b738f57beb3a639a7a90a87999e6660c9a10b62a6524ec833263beaab2d2","observation_id":"3d3576bf-83f4-4c9a-9439-5d73cfdcf179","resolution":{"observed_at":"2026-06-30T23:45:08.228667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:50.611559Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"2383dbc4-0e5d-40ed-a102-5aac37332eae","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:4680552e27fd785f87ac181e076c15e1cdd42bf8ab10679fd91ea699265cc288","observation_id":"ad0976e0-f54c-4ff2-9944-6ad393062896","resolution":{"observed_at":"2026-07-07T10:33:40.264640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.249806Z","title":"A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":"32359d19-5aa1-4309-b5c9-be186728fb8f","year":2019},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:c7c0801a4c4a8227f1bd0df2815de131c6d5c88afe58407c8a889b68560af4f4","observation_id":"f3b0d21a-3025-45eb-a22c-c9dee7fb4e05","resolution":{"observed_at":"2026-07-07T10:33:40.251522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.241438Z","title":"The measurement of observer agreement for categorical data.biometrics, pages 159–174","venue":null,"work_id":"3d83c61a-3d9e-430a-8819-b63caa7a7fe9","year":1977},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:fddc94c85b35533bf293d2c6ec76fb5fc5478531d0d51dc9817d61b40e9819db","observation_id":"7085bb9c-47fe-4f79-8bca-cc182a94ab33","resolution":{"observed_at":"2026-07-07T10:33:40.242940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.239628Z","title":"Video generation models: A survey of post-training and alignment","venue":null,"work_id":"eddc1589-c8e1-4e84-ba0b-6c16aefec776","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:4bdd10a74e3c185502a1984b502eda01c36ef277fae4e714a4ce7755c802e750","observation_id":"ad03681c-d52a-49b6-a5ef-e09c1e0c8229","resolution":{"observed_at":"2026-07-07T10:33:40.240842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.381869Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":"3b03d007-725f-4692-9648-a2785e1e2398","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:2c1a610b613a7f0d65d7c3be1070eceb79958013d916b249afd8be818857626c","observation_id":"0317efd0-ebfc-4283-9024-76ef8e8627be","resolution":{"observed_at":"2026-06-30T23:45:08.195881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.709500Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":"59aaef1a-efc0-4078-b139-ac7e5a7c58f9","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:14d929017ec84d8dce168a25fc81a585feca46692e59df43cc26c519cedc9eed","observation_id":"0770c935-9b86-4a56-92d2-4906dbd1ab50","resolution":{"observed_at":"2026-06-30T23:45:08.249848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.243523Z","title":"Caven: An embodied conversational agent for efficient audio-visual navigation in noisy environments","venue":null,"work_id":"5665d39e-66a4-4aaa-b809-6db17972d747","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:72aba2ca5c461140a7039ffffb535b480294e35c4863037cf579fe3887438e6f","observation_id":"748f8c98-a274-41a2-8867-6dff29af8db8","resolution":{"observed_at":"2026-07-07T10:33:40.247169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.247786Z","title":"Tell what you hear from what you see-video to audio generation through text.Advances in Neural Information Processing Systems, 37:101337– 101366, 2024","venue":null,"work_id":"d50153c7-7a79-4019-a9f4-a520484d2d9e","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:e0915226ff4d3f80279511c89c9625232a2cfb50a1c6c879f633ff0b1d33db20","observation_id":"9eb70423-d81d-4dac-a462-08c57376539d","resolution":{"observed_at":"2026-07-07T10:33:40.249135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:e0f19cdb626bbc23dcd61519b557810d91dd9da1f491f9cc10836fe95d6a1557","observation_id":"32cb4ad9-c698-4217-9117-a4f494c3acf7","resolution":{"observed_at":"2026-06-30T23:45:08.269827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.237853Z","title":"Tavgbench: Benchmarking text to audible-video generation","venue":null,"work_id":"f6ecdee9-0afd-4280-b978-7e219f28fa3f","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:e39fbaeba58efc70ddc168b74021f95f364fc6d915ac3f3dd6644b9919ea42bf","observation_id":"5bd31d78-326f-4c67-bd83-a5f8bc71f341","resolution":{"observed_at":"2026-07-07T10:33:40.239063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:eedfead058c8ab543d5f9d90e2184be35822006fd8d2663eebb50e1c9c500fca","observation_id":"5a7ff603-bb63-429c-94d6-992a18facb2a","resolution":{"observed_at":"2026-06-30T23:45:08.217598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.235957Z","title":"Do gener- ative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958","venue":null,"work_id":"36cb023c-0785-4a5e-9e87-e1470c7daaa3","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f33d7982384057008f81f0b662c96878c2ba816731f8141ce64fd66503d1571f","observation_id":"3dfafc7a-5b28-4f36-b88c-4f1d3cc6e3f8","resolution":{"observed_at":"2026-07-07T10:33:40.237267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.232466Z","title":"Sora 2, 2025","venue":null,"work_id":"81b175e5-e634-42e7-a811-10ee2a25a632","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:057c81c421bba57e881e26fbf8726e3b8296f60e7475939bb798a949dd987821","observation_id":"566884d4-dc78-4da6-b2f2-fe67cda4520c","resolution":{"observed_at":"2026-07-07T10:33:40.233544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04348","last_updated":"2026-04-06T01:43:00Z","snapshot_observed_at":"2026-08-16T16:06:44.375994Z","submitted_at":"2026-04-06T01:43:00Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","version":1},"cited_work":{"arxiv_id":"2604.04348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04348","snapshot_observed_at":"2026-06-30T23:45:08.232528Z","title":"OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text","venue":"cs.SD","work_id":"eba79e0e-d1da-484e-b2c8-d1c5b7a135b5","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.04348","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:8b806923754534ec840166564b3f55249ec3a25101954290453309a6d44429f0","observation_id":"f703365e-a69d-494b-bbf3-5a12f52a8deb","resolution":{"observed_at":"2026-06-30T23:45:08.233900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:9274179f2d6d4b1b3a2d3c74ffd89de4942797dacfc32e1c68a69a3c80b853d0","observation_id":"d376540a-2246-45e3-be74-25853a0dd631","resolution":{"observed_at":"2026-06-30T23:45:08.275677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.230688Z","title":"Savgbench: Benchmarking spatially aligned audio-video generation","venue":null,"work_id":"f8a722d6-e124-4b25-b5cf-f7fda8f18fac","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:31655486816c2da3ed61a18b38b99602d27b7180d07ccbc86dd2988482a376c8","observation_id":"084b07ca-7a41-4ddc-9b31-a0b1e4913807","resolution":{"observed_at":"2026-07-07T10:33:40.231900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:ec4221894b5dcc4e286493192dd211cc929c9c32cecf9e67c9a33eee78aea321","observation_id":"6f2e1459-40fc-48d7-b3f0-8ab806ece0f3","resolution":{"observed_at":"2026-06-30T23:45:08.207476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19132","last_updated":"2024-09-27T20:26:34Z","snapshot_observed_at":"2026-08-16T13:14:38.372324Z","submitted_at":"2024-09-27T20:26:34Z","title":"From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation","version":1},"cited_work":{"arxiv_id":"2409.19132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.19132","snapshot_observed_at":"2026-07-03T13:28:18.779237Z","title":"From vision to audio and beyond: A unified model for audio-visual representation and generation","venue":null,"work_id":"f270194a-9edb-4d53-8fa4-6abdfa42c589","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2409.19132","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:47f2e1ca88d4b61cdc2a793ae21d9378782bbae7296ce3a26d96822a5a95f3d8","observation_id":"4c469386-d564-4fbb-88f1-64ad2f9fc04e","resolution":{"observed_at":"2026-06-30T23:45:08.234269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.829287Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to-video generation","venue":null,"work_id":"94acc5b7-1602-4283-bf34-3549e7250963","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:3e1a7110f3833b122c1da273183ca5ebd2d213fc780f06725e70c44379077348","observation_id":"8b2f2e9b-780d-47b1-9ca5-5bb0fc51fc2d","resolution":{"observed_at":"2026-07-07T10:33:40.235367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.11039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:17:43.949417Z","title":"Sonicbench: Dissecting the physical perception bottleneck in large audio language models","venue":null,"work_id":"b0427e7f-5dee-4e5c-9abe-a744e7538a48","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:66444712dd8f5e3c0680e837815973ffa5a7f760420ecde4c8454eb2d7768dec","observation_id":"f75f7dd6-302c-441e-990d-695c2314aa8a","resolution":{"observed_at":"2026-06-30T23:45:08.208655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-08-18T19:56:03.713377Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2512.16776","doi":"10.48550/arxiv.2512.16776","metadata_source":"pith","pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kling-Omni Technical Report","venue":"cs.CV","work_id":"52d502bd-9d8e-4944-9bf2-cfd097cfdb4e","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:db00e3db810541654b616d1390b36ccecc16e612806a0aa187695284f79eb2a5","observation_id":"b99f848b-3f92-44c0-b1c3-d1f9628e34e9","resolution":{"observed_at":"2026-06-30T23:45:08.219778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.73319+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:18a446433f2cd593b6d11820b78ce34a6c1fddae974d2f8fda92e103db43aa2d","observation_id":"50d22eea-2a04-447b-aa7b-793f65bc697f","resolution":{"observed_at":"2026-06-30T23:45:08.255291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:74ca993b6a66c3b4babde7bc9e09387fc96df9d888b9fb94953e73c473b1c1d0","observation_id":"cd596f24-076e-4356-a092-3b74d53b140e","resolution":{"observed_at":"2026-06-30T23:45:08.226099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-14T19:01:16.242136Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":"2509.06155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-07-05T12:41:04.336871Z","title":"UniVerse-1: Unified audio-video generation via stitching of experts","venue":"cs.CV","work_id":"b460dec5-ca31-4982-8dc8-769dad75efb5","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:7156a4c4e5574cc02819098a4ba822fa89fdaa60742de610fa39e9ecbd592f19","observation_id":"158c2ec1-1e00-4bfa-9c73-b4ea28a3f037","resolution":{"observed_at":"2026-06-30T23:45:08.252808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.23994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23994","snapshot_observed_at":"2026-07-05T12:41:04.333890Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","venue":"cs.SD","work_id":"f195e204-6846-46de-9de8-8ed43724d874","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2512.23994","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:85e60c8f033c1c37da08a01dff30887c9db9e23b8c4099eb53db90f941960ae4","observation_id":"6b087763-ae3e-4f2a-bce9-60e6a324b030","resolution":{"observed_at":"2026-06-30T23:45:08.237129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.252051Z","title":"A survey on video diffusion models.ACM Computing Surveys, 57(2):1–42","venue":null,"work_id":"a88b3ca8-9c1c-4854-9ff2-8d3cdb127965","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:0bb73c53ec74b44c2f1e9af3e222b4dfab43358edac45899f63da23144e98bf9","observation_id":"5ebebb9b-8765-4ce0-aac4-710fb43f94cd","resolution":{"observed_at":"2026-07-07T10:33:40.253226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25427","last_updated":"2026-04-28T09:34:51Z","snapshot_observed_at":"2026-08-17T06:09:26.787125Z","submitted_at":"2026-04-28T09:34:51Z","title":"A Systematic Post-Train Framework for Video Generation","version":1},"cited_work":{"arxiv_id":"2604.25427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25427","snapshot_observed_at":"2026-07-09T03:05:55.283109Z","title":"A Systematic Post-Train Framework for Video Generation","venue":"cs.CV","work_id":"447433fb-ea71-4357-8c19-53b528d34300","year":2026},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2604.25427","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:cb35c311c62dd47a223a4d3ecb41903436badd78915e14669573f8c4286eb217","observation_id":"f7c47df5-db7c-48c4-af0f-dd15dd4d8eca","resolution":{"observed_at":"2026-06-30T23:45:08.213661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:7f1b1a4d8c575060966be3e62edc0e32ba715a439529e1c64546bbd37c09dfe2","observation_id":"3221fd1e-30a0-4801-a237-d9b5617ed036","resolution":{"observed_at":"2026-06-30T23:45:08.266662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.253818Z","title":"Diverse and aligned audio-to-video generation via text-to-video model adaptation","venue":null,"work_id":"eed9447d-4ba4-43c7-b82a-73cc61070ffb","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:f2ca02ec0e3ae9444182fead75ecc53a09f0e5ca9809e3e20e89bbd2dc891ec1","observation_id":"eebe27e9-d3a5-46bd-80e6-a1cc79960dd5","resolution":{"observed_at":"2026-07-07T10:33:40.255030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11700","last_updated":"2024-03-22T08:13:11Z","snapshot_observed_at":"2026-08-16T14:08:50.706415Z","submitted_at":"2024-03-18T11:56:35Z","title":"Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing","version":2},"cited_work":{"arxiv_id":"2403.11700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11700","snapshot_observed_at":"2026-06-30T23:45:08.271539Z","title":"A mallet strikes a xylophone from the longest bar to the shortest. Each bar rings higher than the one before, from deep warm tones to bright high notes","venue":null,"work_id":"22afddd1-f9f3-4a89-97fd-173a04aa5085","year":2024},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2403.11700","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:bacd66b7dbc8891a80bf4028e0f4c6620665ab63c7ace3f5e5a80dcfaff06e7d","observation_id":"da48796b-6c81-455b-8b34-3c8f4ba82f53","resolution":{"observed_at":"2026-06-30T23:45:08.273174Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.261929Z","title":null,"venue":null,"work_id":"dbd05674-f1e9-4e01-b57d-95cea9efed52","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:69e6dafa90215a088558f127c6fe7211825a057e5dcc2837dfb236a1eb352b87","observation_id":"fb640097-828b-45fa-a630-04466d5e7927","resolution":{"observed_at":"2026-07-07T10:33:40.263014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.274193Z","title":"{video.event}","venue":null,"work_id":"7a0a973e-a2f4-4647-a1aa-926132d7bd4b","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:867f46abdc390265e424cddc32f6a5396486d5cfa19673a41d7457a4b22a96f4","observation_id":"b2ccf433-5f3d-40cc-a41d-fa46ed0d7a46","resolution":{"observed_at":"2026-07-07T10:33:40.275271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.228749Z","title":"would normally be audible if real-world physics held; answer Yes if they are appropriately represented as such (typically silent here)","venue":null,"work_id":"280cc492-0e39-41d5-820d-ac1e367eafb5","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:988645cd0b2fda665199299ff865bdb7f2aba2995a44689ccb0eeede18bce94d","observation_id":"8b5a116c-98b3-4886-827c-d5f100057b03","resolution":{"observed_at":"2026-07-07T10:33:40.230063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9340.9850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T23:45:08.262195Z","title":"the clip is expected to be silent during the depicted event; answer Yes if it is appropriately silent throughout with no audible leak-through","venue":null,"work_id":"8151e355-66bd-479b-8c62-fa986915632d","year":null},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:63b949cc9f57687b6298462e2ef4c717db23cf05cac8f4c978192a097b34cdb1","observation_id":"ea3732ce-2cc2-4940-ac13-347e774178af","resolution":{"observed_at":"2026-06-30T23:45:08.263931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T11:43:16.628178Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":27,"verified_fuzzy":23},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2605.07061."}