{"as_of":"2026-08-05T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:381f0019d8b320aadb2264bdd0998bb2e744205efca4b7fd5e83eee10dbc6a99","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T02:16:45.554252Z","state":"measured"},{"denominator":198,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":198,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":101,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:20:10.044650Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2510.10254","last_updated":"2026-04-23T20:34:04Z","snapshot_observed_at":"2026-08-01T16:05:11.289787Z","submitted_at":"2025-10-11T15:19:03Z","title":"Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T07:25:04.166352Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2510.10254"},"observation_digest":"sha256:1d36b3c125ee4dc8f7e1bfea955eef8b3ceefacc3b8f00cfac78d8075e412e49","observation_id":"00d0a81b-6dc7-4915-9968-81d4395ce2ad","resolution":{"observed_at":"2026-05-18T07:26:02.994509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-04T08:20:10.044650Z","title":"Haibo Yang, Yang Chen, Yingwei Pan, Ting Yao, Zhineng Chen, Chong-Wah Ngo, and Tao Mei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.21615","last_updated":"2026-06-17T16:22:08Z","snapshot_observed_at":"2026-08-04T08:20:06.021700Z","submitted_at":"2025-10-24T16:21:37Z","title":"Epipolar Geometry Improves Video Generation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:20:10.044650Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2510.21615"},"observation_digest":"sha256:74b336136cf2f8c76ad8c31d7ff500d561484549f3eea7023f0843b1eed19921","observation_id":"5deacf6f-7f5c-4b23-8a73-47a005454c83","resolution":{"observed_at":"2026-08-04T08:20:10.044650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3d1372dc647a68fec848cadf2c1d21b6fb9af74ba2a1e2c4f156c87aca2d192c","observation_id":"9980435e-eb6a-4904-aba3-28082a0df574","resolution":{"observed_at":"2026-05-18T00:55:35.077440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2511.17792","last_updated":"2026-04-15T17:49:12Z","snapshot_observed_at":"2026-08-02T16:58:42.389912Z","submitted_at":"2025-11-21T21:36:02Z","title":"Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T20:00:20.895672Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2511.17792"},"observation_digest":"sha256:823fb3a1fe89babb695f3a40bf64959216d81e7e48ddac4394bd4dddf72631ae","observation_id":"6e03a2a8-bdb5-47e1-b374-98b9b0fffd5d","resolution":{"observed_at":"2026-05-17T20:02:04.211945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T20:16:13.958140Z","title":"Video models are zero-shot learn- ers and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20562","last_updated":"2026-06-26T07:28:21Z","snapshot_observed_at":"2026-08-03T20:16:09.429548Z","submitted_at":"2025-11-25T17:59:04Z","title":"PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:16:13.958140Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2511.20562"},"observation_digest":"sha256:1e6b6b1e992d00b8b42c79521b441c1d182241bae99f12c49b5f08a079444bc1","observation_id":"bb196b9e-e861-4f40-abcd-3af5ff1f6414","resolution":{"observed_at":"2026-08-03T20:16:13.958140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T19:11:52.916096Z","title":"Video models are zero-shot learn- ers and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-03T19:11:45.881397Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:52.916096Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:a5b60ac2cd5b48296fca28dfdca5ba402939a7179b2684f7507d83a957eb13cd","observation_id":"a76490f6-51a5-4fbc-a34f-6206a431792d","resolution":{"observed_at":"2026-08-03T19:11:52.916096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:11e5eae9f22ff56b1409fc81ce3dd6e34a9cdd09af44f1a0e7263a4a206befcc","observation_id":"0aeee703-2ac3-4b4b-beac-aedc66bd6505","resolution":{"observed_at":"2026-05-16T18:17:55.050614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f08492e15b29f66a4616c91e4861e70860b7524ddd3f142f4c7e48a4a344bb99","observation_id":"297246b8-0278-49a7-862c-6a00eee4c807","resolution":{"observed_at":"2026-05-17T00:08:43.190117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T14:29:56.348733Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:726412dfc1e1ebba614a9d16a1f19b7897794516cad846637326fbf0b37e0862","observation_id":"ebe77d37-8928-48fa-8bc9-0858cb0472b3","resolution":{"observed_at":"2026-05-15T14:29:56.460133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T16:11:17.633640Z","title":"Video models are zero-shot learn- ers and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T16:11:17.633640Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:88a26f331dac0b74bed120e5bbdccef4562578e0638be513499a8430dd5077b6","observation_id":"c9dc0b19-4e8f-4c0e-a3cb-92c671ce8b7e","resolution":{"observed_at":"2026-08-03T16:11:17.633640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:74ea360aacdf50c8f5442be8b5d3461e6c41196f31bac048fb2a9d6cb21f550f","observation_id":"e49a4b71-0c03-4438-a892-7a4551b8a785","resolution":{"observed_at":"2026-05-15T10:41:00.243691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T15:46:12.576413Z","title":"Video models are zero-shot learners and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-03T15:46:03.731716Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:12.576413Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:eb117dd37bb17d3f9a546c83925c10856bd7d408f23d12ea130fd06a907001f8","observation_id":"f80e95d7-ac90-4e57-ba48-0adcc831f0e5","resolution":{"observed_at":"2026-08-03T15:46:12.576413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T21:00:58.473043Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.16776"},"observation_digest":"sha256:868b24404234f1118dd0f2a37df2254118d05bb19915437a9b4f74ea2fec78b0","observation_id":"7c56be35-e66c-4d41-bbbf-538729048392","resolution":{"observed_at":"2026-05-15T21:00:58.607229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:a04e1a9703f4b691b34e63b5ae09223bf6f2140e202f7b5527c91581d3f077b5","observation_id":"eb08817f-69c5-4bf1-a53c-249ee7977af4","resolution":{"observed_at":"2026-05-16T19:38:21.076677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2601.08565","last_updated":"2026-04-06T17:51:33Z","snapshot_observed_at":"2026-08-02T21:03:24.619262Z","submitted_at":"2026-01-13T13:49:05Z","title":"Rewriting Video: Text-Driven Reauthoring of Video Footage","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:59.050484Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2601.08565"},"observation_digest":"sha256:1059a21ca3137f4ee9795a9f1e9dd5be123264067e22daa678daf13db14135ef","observation_id":"c412de83-6508-4305-90d1-588dfac72819","resolution":{"observed_at":"2026-05-16T15:08:02.125676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T08:56:10.974820Z","title":"Video models are zero-shot learn- ers and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15284","last_updated":"2026-07-29T04:41:17Z","snapshot_observed_at":"2026-08-03T08:56:07.163640Z","submitted_at":"2026-01-21T18:59:32Z","title":"Walk through Paintings: Egocentric World Models from Internet Priors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T08:56:10.974820Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2601.15284"},"observation_digest":"sha256:4dba8be429bbf865e4a5036708c1e51197173d2c5c69974898a1f20b8cc8e3ae","observation_id":"8cff95ed-22f9-420a-a778-817638137559","resolution":{"observed_at":"2026-08-03T08:56:10.974820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T05:23:36.362402Z","title":"S., Matarese, N., Swersky, K., Kim, B., Jaini, P., and Geirhos, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-03T05:23:28.259581Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:36.362402Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:f15c420ba7036a8b1456f0c7a7fd060a9040d8f389f610816244771070c1f2d5","observation_id":"7e1b603e-3425-4ea3-a639-ce4b70dcfe05","resolution":{"observed_at":"2026-08-03T05:23:36.362402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2602.04876","last_updated":"2026-05-20T07:57:24Z","snapshot_observed_at":"2026-07-06T22:44:33.166340Z","submitted_at":"2026-02-04T18:58:55Z","title":"PerpetualWonder: Long-Horizon Action-Conditioned 4D Scene Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T13:26:57.909496Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2602.04876"},"observation_digest":"sha256:c2ba59f8da0b08f5856af588eee6794ef185420a0c6e67ce0b75024d21fff23e","observation_id":"42e9d9c3-35f6-4d26-9826-aeb083b53ec1","resolution":{"observed_at":"2026-05-21T13:30:12.715082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:50b438a88a809977eae0f5860a99dac2247a21ac1cf84612deebd74c872e09b7","observation_id":"f02c4f4e-950a-42bb-bc05-791687929a38","resolution":{"observed_at":"2026-05-16T17:02:34.202125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T01:20:05.597563Z","title":"S., Matarese, N., Swer- sky, K., Kim, B., Jaini, P., and Geirhos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-03T01:20:03.338758Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.597563Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:fff3efd66742ff5a321f0c41fc74a62bafc1b629ea6ca31777a3ef6b7bf12a2f","observation_id":"d4271ad1-e621-4140-b318-795f780d4f68","resolution":{"observed_at":"2026-08-03T01:20:05.597563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T16:09:57.751185Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:5eac6bd30b6ff062c23b2a7313f94c1714b5aa3e292dc775d0c5d99c0724efb4","observation_id":"9b18cd75-4f0e-42f7-9e8b-5b7d318d266e","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T02:33:59.549335Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T16:09:57.751185Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:59.549335Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:b6d0975b59436d1aba2e9497a8c3912b357aaf7c6529fab14d01e637e7eaf10c","observation_id":"235c9488-a005-442c-aae0-b67a4bbaab26","resolution":{"observed_at":"2026-08-03T02:33:59.549335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2603.17834","last_updated":"2026-04-26T06:47:15Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T15:27:17Z","title":"Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T08:39:03.661087Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.17834"},"observation_digest":"sha256:0345aa70fc9e2154820b5810b9d6a01c635e90564d4edd6acce127545ff87d10","observation_id":"1b78b9f2-52b7-4f9b-81f4-541eb2d1fe70","resolution":{"observed_at":"2026-05-15T08:39:52.189510Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2603.21210","last_updated":"2026-06-30T12:08:53Z","snapshot_observed_at":"2026-08-05T08:50:28.616444Z","submitted_at":"2026-03-22T13:08:01Z","title":"Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T07:01:08.953346Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.21210"},"observation_digest":"sha256:0e62509ec44a6b30698aaf798e114fdb0b471ca812e92695eb7cd12410f0b72c","observation_id":"ba64a69c-d493-454d-91a5-a60a73667133","resolution":{"observed_at":"2026-05-15T07:05:11.529257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2603.28980","last_updated":"2026-05-01T15:42:39Z","snapshot_observed_at":"2026-08-02T14:38:28.581579Z","submitted_at":"2026-03-30T20:26:28Z","title":"Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T21:13:40.764990Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2603.28980"},"observation_digest":"sha256:d09659b2178cde2ef6feb033846eaeff2115e90c9bac84d9c573cb7221b62de3","observation_id":"a5cc8712-4230-45de-b03c-9803796d2771","resolution":{"observed_at":"2026-05-14T21:17:59.786293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-13T14:17:59.568752Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01641","last_updated":"2026-07-03T05:51:13Z","snapshot_observed_at":"2026-07-30T22:10:22.621848Z","submitted_at":"2026-04-02T05:38:48Z","title":"LivingWorld: Interactive 4D World Generation with Environmental Dynamics","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T14:17:59.568752Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.01641"},"observation_digest":"sha256:b33d6b23a5491e59698a7e1a65565bb12365ba4d761502a386c39e1d1cb4c381","observation_id":"46d4b097-e5b1-45cb-9639-013698813b3f","resolution":{"observed_at":"2026-07-13T14:17:59.568752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:8b6e0205151f27d7f948ee4f9436374f57f51cb8f063984aa95a4be11e6af03a","observation_id":"925b46ba-2822-46e1-8030-7a14036a260e","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"Video models are zero-shot learners and reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:f9f8a4033fe287170402c3038bd8eae95b745051d6f7bdd67a8b1be0839424fa","observation_id":"243eeb01-d7d0-4e85-8212-34c02326e6c8","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.06425","last_updated":"2026-04-16T21:05:33Z","snapshot_observed_at":"2026-08-03T21:52:06.953050Z","submitted_at":"2026-04-07T20:01:05Z","title":"Neural Computers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:09.594072Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.06425"},"observation_digest":"sha256:ebb60d4c117e0896f74f5f55ea478246dd79bf176ae2df0187bead025e79a4fb","observation_id":"e17e2b26-c9dd-43f8-9081-405113acdb3f","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.09330","last_updated":"2026-04-10T13:59:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T13:59:54Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:31.378588Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.09330"},"observation_digest":"sha256:30b5eb5ce474a829bbfa4ab1123ba8b765f991b24e0fd0a073475d37b339b2ec","observation_id":"1cf11679-e11a-4b4b-a1b7-60848a6e8e6b","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.09429","last_updated":"2026-05-29T10:18:20Z","snapshot_observed_at":"2026-07-12T23:14:50.751272Z","submitted_at":"2026-04-10T15:47:23Z","title":"Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:19:50.116736Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.09429"},"observation_digest":"sha256:a3ce43f05e37728a889cee2c4d158eb4311eba7c1ccaa351488c11ab05d272f5","observation_id":"984ba074-04f9-4fe4-b1f8-ff33c0703bb3","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-12T23:14:56.161802Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.09429","last_updated":"2026-05-29T10:18:20Z","snapshot_observed_at":"2026-07-12T23:14:50.751272Z","submitted_at":"2026-04-10T15:47:23Z","title":"Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T23:14:56.161802Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.09429"},"observation_digest":"sha256:f92f7880e15a8123dfd205b3e0965ae245b1667154aa9c80aff06a84df3d22c5","observation_id":"87becae0-5a4f-45a6-85cd-7f1ed152188d","resolution":{"observed_at":"2026-07-12T23:14:56.161802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.10385","last_updated":"2026-07-14T05:51:48Z","snapshot_observed_at":"2026-08-02T10:57:31.860855Z","submitted_at":"2026-04-12T00:01:51Z","title":"GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:10.956726Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.10385"},"observation_digest":"sha256:968a1218a57c3f17cb9187f8cebfccb070ac80127498b5eae38150648d8f3abb","observation_id":"c4aeb11e-a523-4b42-9660-0de421449b27","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":185,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:a688e933c1d3c285edfbec9e0581d49e1ad69e6940b02cdded341ef0f4cc541c","observation_id":"05dc2edd-95c2-4580-b303-04baf8f8cb4e","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.13425","last_updated":"2026-04-15T02:51:26Z","snapshot_observed_at":"2026-07-29T22:35:10.634628Z","submitted_at":"2026-04-15T02:51:26Z","title":"VibeFlow: Versatile Video Chroma-Lux Editing through Self-Supervised Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T13:15:35.258754Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.13425"},"observation_digest":"sha256:fbc9b2a7b6a3e8b49228455b5eb066464bfe58a00889a567e1c139943c7d3510","observation_id":"ac169a5b-0bba-4a6a-b831-076d4fa5b746","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:50:04.001693Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:9a6bbe61d4afda6ef5a1586be047340eab67172fba3650a40c372ec121322b05","observation_id":"1b480e70-761c-44a2-9e30-df8eb095ca8e","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.16503","last_updated":"2026-05-19T02:31:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T15:09:39Z","title":"Motif-Video 2B: Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T00:12:23.096146Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.16503"},"observation_digest":"sha256:483f5ba87d04a71821489e9ec80f23984f0da233ec0be94a6b379b479344146e","observation_id":"735057b6-9c5a-4d3b-b333-b96c82f07fab","resolution":{"observed_at":"2026-05-21T00:13:53.063109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.17623","last_updated":"2026-05-20T22:21:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-19T21:21:11Z","title":"ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:39:49.102468Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.17623"},"observation_digest":"sha256:71134cf45da9b0d34e85dd1c77ea9fb89cffb6a453787627e9e1924bc2555a35","observation_id":"23898561-f7fc-4679-b269-768414dbec70","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.17623","last_updated":"2026-05-20T22:21:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-19T21:21:11Z","title":"ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T11:31:26.240607Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.17623"},"observation_digest":"sha256:31683c98734494e009cc7e5665c67604462671b2cb4e56fbf14dca49d60f7a22","observation_id":"0c5c945e-32b6-4df0-b193-7bbd5026eb61","resolution":{"observed_at":"2026-05-22T11:31:29.234533Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.17673","last_updated":"2026-04-20T00:02:00Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-20T00:02:00Z","title":"Grokking of Diffusion Models: Case Study on Modular Addition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:08.221886Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.17673"},"observation_digest":"sha256:b65ad8e3cbbb7387dfaa85411913a74f4f21b29310633f385dd419537466f40f","observation_id":"32b338c2-0eae-413b-b304-250bb2a6c282","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.18215","last_updated":"2026-04-21T16:05:42Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:00:17Z","title":"Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T04:49:44.525757Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.18215"},"observation_digest":"sha256:2436d6464f933b8149cdf5155bbd3bb6efeae7ac0ff6c2a5fd9a2cbd51e0598d","observation_id":"47e19029-4357-4292-be91-2dfa8b99743b","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:8e2bbabd3f9af8bb9c4f51961b830707e8346770dc4fe414a2f281f5465c8b9b","observation_id":"4daf5438-bf57-48ba-a6d8-7872d39fc58c","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:05.034951Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.20329"},"observation_digest":"sha256:e79f95638b62f10f0b82f0e27fa7bebeddebc477df515b2b9947685e8a5b9ce1","observation_id":"3b411e37-1b73-450a-b891-3cdfb1d70d9e","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T07:40:46.090808Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2604.20329"},"observation_digest":"sha256:9dcd91437b98839c7dbac187c1bb6c20d73aff82009486ec7714ae89087c9850","observation_id":"45cefcfd-2ef4-4145-93d7-257f374f74b8","resolution":{"observed_at":"2026-05-15T07:45:14.717890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.04566","last_updated":"2026-05-06T07:11:50Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:11:50Z","title":"Open-Source Image Editing Models Are Zero-Shot Vision Learners","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T16:44:53.286118Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.04566"},"observation_digest":"sha256:c75114670066c1e2fae4a864644e532f2fdb819402d91124bae74b1a69b2892e","observation_id":"18e25512-3d4f-42c9-ad82-d92c2eefc363","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T13:30:47.547011Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:a4737c8ee8c7c2da7c44f3aae520a7979afa65440e0c4b6a73b1868252858f31","observation_id":"0b894adf-48d8-4de1-b4e2-34205f2d0048","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:23.616363Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:85d994b11a06423cce27f5ebec653be6f2558d3b060eb726de3dc557eeefc1f8","observation_id":"cf7d03c2-7f76-4988-a158-239e9d3dcd04","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T06:58:57.520289Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:ef015b242b21c4ec7c326515546cf476e9e56a3cbdf1f479eb712311c3bd603c","observation_id":"389e8009-68a0-4f98-92c5-77ccaefd2b8c","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.06280","last_updated":"2026-07-12T05:10:37Z","snapshot_observed_at":"2026-07-16T23:18:43.140861Z","submitted_at":"2026-05-07T13:53:31Z","title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:13.965611Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.06280"},"observation_digest":"sha256:16a296b65e3874304e99352719659314ea076eb99df9f23984a11cda49bd6514","observation_id":"04aa48ef-e24c-40e1-88ea-b60f033b90f2","resolution":{"observed_at":"2026-07-01T13:25:44.802759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.08735","last_updated":"2026-05-09T06:39:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T06:39:17Z","title":"CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:17:30.227755Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.08735"},"observation_digest":"sha256:0efa23ad3e69406adb195f483fcae064cc8b845a9baed2b9dacb51dbbb8d6de3","observation_id":"697e63d6-4fd3-42be-9818-d8fab8f63292","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.09422","last_updated":"2026-05-10T08:48:58Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:48:58Z","title":"Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:57.791351Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.09422"},"observation_digest":"sha256:073650aa2936547118147685a3374fc7ecbd3dd68ee279118164dfb6c407dd85","observation_id":"5be5ac0f-af33-4fd4-8469-02e0762a63c6","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-03T00:00:10.613016Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:bb6dc6d847ad60411080f2a6435348acc53901a4276f16b6ac2a714fc7c5d5cd","observation_id":"32b52f5c-3574-4a18-aa09-c33c549bf975","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.10409","last_updated":"2026-05-11T11:47:44Z","snapshot_observed_at":"2026-08-05T08:00:45.545070Z","submitted_at":"2026-05-11T11:47:44Z","title":"Progressive Photorealistic Simplification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T03:57:50.443100Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.10409"},"observation_digest":"sha256:b715907b3bb8a8064866784e344087e9419130a012659d0542eff81a6db34dc4","observation_id":"145f546c-a99d-4267-aeb7-7ef1b2de59ae","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.10434","last_updated":"2026-05-11T12:06:57Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:06:57Z","title":"WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:01.254916Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.10434"},"observation_digest":"sha256:ef67320d9a9cca7f2387b44cb25a40be779d446286b5beadbd142df0cce8140b","observation_id":"425ab599-d4ba-4dc6-8df2-a395cc433f46","resolution":{"observed_at":"2026-05-14T02:16:46.105477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-08-01T23:49:14.751351Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:7409a6bae6c0e06554d7d60d9e66247d3e631710dafb85e83df126c21dd644c8","observation_id":"99de3e62-1ccb-4dcf-81dd-0fa80f3c5d32","resolution":{"observed_at":"2026-05-19T15:07:37.122050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.17423","last_updated":"2026-05-17T12:38:21Z","snapshot_observed_at":"2026-08-01T16:00:11.560764Z","submitted_at":"2026-05-17T12:38:21Z","title":"Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T13:15:54.413960Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.17423"},"observation_digest":"sha256:fa59fcb8ede8887e4b4d7f22b4308bbfe648ca6ba7a966149793344643f9f40b","observation_id":"5d5396a0-1d46-41f5-8166-401dbc58a4e7","resolution":{"observed_at":"2026-05-20T13:18:18.293926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.17522","last_updated":"2026-05-17T16:11:22Z","snapshot_observed_at":"2026-08-02T10:06:26.951786Z","submitted_at":"2026-05-17T16:11:22Z","title":"RoboFlow4D: A Lightweight Flow World Model Toward Real-Time Flow-Guided Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T12:34:11.744980Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.17522"},"observation_digest":"sha256:2644fca352c1146765b4a0ae42ad6b68fde9f971b9f9285fba3abe383b52c2e8","observation_id":"030c2cfc-0d4b-4ecf-acc3-44152f3c6e53","resolution":{"observed_at":"2026-05-20T12:38:17.021889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-02T07:31:08.555715Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:381930953a9a3e16261340b0dfb878c6e1c95c5cc2f66c8627584704bf72cadd","observation_id":"bacafae6-d485-41d0-bd49-fa5299c96311","resolution":{"observed_at":"2026-05-20T11:08:13.567132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:10b25c1a1f829d1ac79c089662d73c102e22844114bee6521b9709fb946ff43f","observation_id":"69863998-34f2-4cb3-8c98-2f504caefe43","resolution":{"observed_at":"2026-05-20T07:33:07.612602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.19360","last_updated":"2026-05-19T04:42:47Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:42:47Z","title":"Scalable, Energy-Efficient Optical-Neural Architecture for Multiplexed Deepfake Video Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T06:30:12.892474Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.19360"},"observation_digest":"sha256:1b4ddc997a6ade58af605ae01c6e09889dddd98b384d43606b34f43d50fdf088","observation_id":"1bffb555-5f83-4d1b-98dd-642440800660","resolution":{"observed_at":"2026-05-20T06:33:05.467216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.22570","last_updated":"2026-05-21T14:48:35Z","snapshot_observed_at":"2026-08-02T20:47:32.000183Z","submitted_at":"2026-05-21T14:48:35Z","title":"VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-22T07:12:02.612292Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.22570"},"observation_digest":"sha256:b5ee6e862790a45f1a2fb03fe44a18e8feb8495d2b5808fc1f3a471e838fc492","observation_id":"29bc56db-8e81-4077-b4cb-7a4792f2284f","resolution":{"observed_at":"2026-05-22T07:14:42.762103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.22818","last_updated":"2026-05-21T17:59:36Z","snapshot_observed_at":"2026-07-06T23:33:04.856017Z","submitted_at":"2026-05-21T17:59:36Z","title":"MotiMotion: Motion-Controlled Video Generation with Visual Reasoning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-22T05:51:17.890788Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.22818"},"observation_digest":"sha256:2ed3800937eed6952ba78f86138fd3634b12d8ff771116bdfec9c2355dc78880","observation_id":"6c87aaae-e097-4264-b3d9-d151a9ac0836","resolution":{"observed_at":"2026-05-22T05:54:38.705592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.26918","last_updated":"2026-05-26T12:16:41Z","snapshot_observed_at":"2026-08-01T21:44:13.728036Z","submitted_at":"2026-05-26T12:16:41Z","title":"Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T18:17:52.284353Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.26918"},"observation_digest":"sha256:b68dffe56a15a36995cb1b79686f67b7a78036aadcf4b4a8e2a6a2ac2da0c5fa","observation_id":"e8e8d0ad-deb8-487e-8684-fefbe74f49a3","resolution":{"observed_at":"2026-06-29T18:23:50.894400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.28816","last_updated":"2026-05-27T17:59:31Z","snapshot_observed_at":"2026-08-05T12:39:49.226899Z","submitted_at":"2026-05-27T17:59:31Z","title":"Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T13:34:03.020051Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.28816"},"observation_digest":"sha256:12f4f7f6c70f0b356ec0e064cb2b008d73d80aef40ccae65bb16e304eb63b4f6","observation_id":"74fa3fa4-a446-41b2-b1b6-4b3f4c61aac9","resolution":{"observed_at":"2026-06-29T13:53:29.102899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.00267","last_updated":"2026-05-29T18:57:57Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T18:57:57Z","title":"StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:58.629263Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.00267"},"observation_digest":"sha256:0b3e7a9a96e23d56cdbdcbf5f38ea62b25ce110da2c19138fcfb08347fea2a7b","observation_id":"76e35556-fa49-42d9-8c92-057d85e24d5d","resolution":{"observed_at":"2026-07-01T19:25:59.817219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.00499","last_updated":"2026-05-30T03:13:00Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T03:13:00Z","title":"OptiWorld: Optimal Control for Video World Generation under Physical Constraints","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T19:02:51.848742Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.00499"},"observation_digest":"sha256:eb1af7caf136372db95471f9e2953b2a0151a5783ac1360c1231eb0b7f477dc3","observation_id":"1dc5ba28-b9fc-4ef2-bf5e-601f76404a6c","resolution":{"observed_at":"2026-06-28T19:32:35.523797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.01362","last_updated":"2026-05-31T17:33:14Z","snapshot_observed_at":"2026-08-02T17:53:31.376798Z","submitted_at":"2026-05-31T17:33:14Z","title":"AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:55:23.583463Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.01362"},"observation_digest":"sha256:c79df16416ee2101dffb12b8e5ad807b12fff06c59ede5f2a2e83f5cc0362969","observation_id":"1b146f1f-0cb9-4312-8b2c-a0c5c6d7bdc2","resolution":{"observed_at":"2026-07-01T21:56:16.370934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:26:21.284810Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:394788c96e69f397653c866b0f83a340f8b38a8aa0693e2ac12094e2f6fa8352","observation_id":"871081c3-33ae-4a0e-ba68-9dc2fedbbb32","resolution":{"observed_at":"2026-07-01T22:26:17.218172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T10:38:22.619277Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.02564"},"observation_digest":"sha256:3c00e3727aaf19216a88d6d13f768ca7e40b9188d8a2036fc9f05d1524048e5f","observation_id":"997a36fb-569a-42a8-b392-62f02be18087","resolution":{"observed_at":"2026-06-30T10:44:36.802140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:08:33.957835Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.02800"},"observation_digest":"sha256:951c17e075119ef41afe0cdb61d253d8a968a79555ba8ede77f14b16fdf8794e","observation_id":"0ed2161f-86dc-48bf-80ec-fcf968de0120","resolution":{"observed_at":"2026-07-01T22:46:18.400971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.03943","last_updated":"2026-06-02T17:30:50Z","snapshot_observed_at":"2026-08-04T20:12:09.441666Z","submitted_at":"2026-06-02T17:30:50Z","title":"PointAction: 3D Points as Universal Action Representations for Robot Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:48.280446Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.03943"},"observation_digest":"sha256:25f7b64804c3478d3aec705564ad2c3813f8420a59e44913b51ddec74a039158","observation_id":"52cef885-4b75-4b3c-8992-f7eeac9d89a1","resolution":{"observed_at":"2026-07-02T03:16:34.972421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.08514","last_updated":"2026-08-04T12:17:45Z","snapshot_observed_at":"2026-08-05T16:28:10.057041Z","submitted_at":"2026-06-07T08:40:43Z","title":"OmniTryOn: Video Try-On Anything at Once!","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T19:00:44.243335Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.08514"},"observation_digest":"sha256:72362ff8a1e4990fc1d78c5e049db9edbe85e0dc65339abe4627edb32ce8bb9a","observation_id":"59b46e92-a43b-454f-8eab-708b51a08e82","resolution":{"observed_at":"2026-07-02T22:17:26.380398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.10127","last_updated":"2026-06-08T20:00:42Z","snapshot_observed_at":"2026-07-06T23:49:22.753911Z","submitted_at":"2026-06-08T20:00:42Z","title":"Data-Driven Automation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T13:58:40.370152Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.10127"},"observation_digest":"sha256:918d455e79e6ab83542ea7534f1f4ad9b770ca11ed0de41dcc36b5c1fa240fbc","observation_id":"851a4ec4-c9d4-4a56-922d-7e0f3139c5a7","resolution":{"observed_at":"2026-07-03T04:27:36.195390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.10967","last_updated":"2026-06-09T15:08:43Z","snapshot_observed_at":"2026-08-05T06:47:41.565657Z","submitted_at":"2026-06-09T15:08:43Z","title":"Quo Vadis, Visual In-Context Learning? A Unified Benchmark Across Domains and Tasks","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T13:24:48.138643Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.10967"},"observation_digest":"sha256:ccc5eaca802b9061ccf45e5c77af197a60c5ed43ffd72dc03939840b62fe4bec","observation_id":"6ce2e47a-a03b-4ff9-835b-5cad02df67d7","resolution":{"observed_at":"2026-07-03T05:07:39.113513Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:42a09ce60bbea06c778deacdafbb794fdf4f097523d250044bbc867d0d35a54b","observation_id":"2b1b0719-1c48-459f-b10e-4a5201d8595e","resolution":{"observed_at":"2026-07-03T05:47:41.341692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.12028","last_updated":"2026-06-10T12:51:25Z","snapshot_observed_at":"2026-07-06T23:51:02.805629Z","submitted_at":"2026-06-10T12:51:25Z","title":"VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T09:32:03.146878Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.12028"},"observation_digest":"sha256:ea0f0679d7aacf51d40bff0c73620ebefd5951a4b95a4086f3a4c28eafcc21b8","observation_id":"6aad9cc6-d226-435e-90f7-3bc87b10614d","resolution":{"observed_at":"2026-07-03T11:28:04.540519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.12072","last_updated":"2026-06-10T13:40:19Z","snapshot_observed_at":"2026-08-02T21:32:50.432496Z","submitted_at":"2026-06-10T13:40:19Z","title":"World Model Self-Distillation: Training World Models to Solve General Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T10:16:35.511426Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.12072"},"observation_digest":"sha256:f29ec4fdb3493d5adb63156efd561391ba7e3b82710caedcae2e4a3057e5bc22","observation_id":"3cf84998-9a19-450d-a02b-c440560e3faf","resolution":{"observed_at":"2026-07-03T10:07:55.828142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.13672","last_updated":"2026-06-16T20:54:22Z","snapshot_observed_at":"2026-08-03T20:34:35.412778Z","submitted_at":"2026-06-11T17:59:15Z","title":"WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:22:47.622007Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.13672"},"observation_digest":"sha256:a01bf24330cef6b8ea6785d1a7800b6b81c18e5166210011e4425ff3029be967","observation_id":"2765f2ef-669a-46b6-8033-9fd7646e9c92","resolution":{"observed_at":"2026-07-03T15:38:34.121144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.15015","last_updated":"2026-06-18T06:53:24Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T23:24:41Z","title":"NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T04:25:27.067362Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.15015"},"observation_digest":"sha256:6085d268d57cf140c80eb198b7681eb314b829665a319303249a915e9cb45119","observation_id":"900e083e-6dc4-4831-9237-075a15147f80","resolution":{"observed_at":"2026-07-03T17:18:43.360556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.18943","last_updated":"2026-06-17T11:23:52Z","snapshot_observed_at":"2026-08-01T03:49:23.750491Z","submitted_at":"2026-06-17T11:23:52Z","title":"Physics-IQ Verified","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T21:13:36.568700Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.18943"},"observation_digest":"sha256:ce62b100233ddeeca64ea0766e28ce5ca5bbef54ceea53a4259d3444e569a170","observation_id":"24a22b57-39c7-4bfd-bb47-1c06a3136b9f","resolution":{"observed_at":"2026-07-04T00:29:15.593809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.24876","last_updated":"2026-06-23T17:53:41Z","snapshot_observed_at":"2026-08-02T11:38:51.210947Z","submitted_at":"2026-06-23T17:53:41Z","title":"FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:11.534272Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.24876"},"observation_digest":"sha256:bd161dd6510a75deab42cd372892aff9800eaa8a098a7266c413e5bf25b9b14c","observation_id":"dfa7dfc3-070c-45e7-bb53-d6ad772fdd4d","resolution":{"observed_at":"2026-07-04T16:49:58.078372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.26916","last_updated":"2026-06-25T11:53:27Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T11:53:27Z","title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:53.011837Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.26916"},"observation_digest":"sha256:2efa86622e1aab629d23dfdef22a724e8b73aebe9a8b75ee8bdbd9137becfcce","observation_id":"0b66c0aa-f0f9-44b7-a1ef-ad9f4fd0a122","resolution":{"observed_at":"2026-07-04T13:19:51.050647Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.28531","last_updated":"2026-06-26T18:30:00Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T18:30:00Z","title":"A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-30T00:59:50.478584Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.28531"},"observation_digest":"sha256:e88b28248b71e91530e7cec99248e428af924eede195990c577da90ffd5a9a55","observation_id":"5759d396-7558-45f8-b65a-d45dedb64175","resolution":{"observed_at":"2026-07-01T15:45:48.900946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:7fc481a39e20c298f39a729238f536f082e1afcd25fd8978ce9aaf48aa86f992","observation_id":"981ed76b-0c7d-4df0-a74e-595e213c2758","resolution":{"observed_at":"2026-07-01T10:05:40.347769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-12T07:34:02.473153Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02712","last_updated":"2026-07-02T18:56:22Z","snapshot_observed_at":"2026-07-12T07:34:01.952241Z","submitted_at":"2026-07-02T18:56:22Z","title":"Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T07:34:02.473153Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.02712"},"observation_digest":"sha256:25d368bf6e9fb3a75691f4e9095a4aab1985f9458f5586a1d91b7b9b4cf2c152","observation_id":"e8ddcdf1-dfc9-41a5-b97d-2a8bbc1f8a1d","resolution":{"observed_at":"2026-07-12T07:34:02.473153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-12T00:04:25.954963Z","title":"arXiv preprint arXiv:2509.20328 (2025) MiPO 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03770","last_updated":"2026-07-04T08:42:08Z","snapshot_observed_at":"2026-08-02T04:46:19.588602Z","submitted_at":"2026-07-04T08:42:08Z","title":"Self-Improving Diffusion Classifiers with Minority Preference Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T00:04:25.954963Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.03770"},"observation_digest":"sha256:40a8dc1a537d5a9326889dd96e873c875fc8c430da4b9dfe6b26cb1eafe2c4e5","observation_id":"0db48952-a698-4bfa-939b-d25a5512eb4c","resolution":{"observed_at":"2026-07-12T00:04:25.954963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-11T15:23:22.681709Z","title":"arXiv preprint arXiv:2509.20328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04674","last_updated":"2026-07-06T04:59:17Z","snapshot_observed_at":"2026-08-02T08:16:02.736330Z","submitted_at":"2026-07-06T04:59:17Z","title":"Video Generation Models Are Inherent Lighting Estimators","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T15:23:22.681709Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.04674"},"observation_digest":"sha256:11f561356aa307be7d59c8533eb5d8f283f87247b7277454285db73f5252ac7c","observation_id":"b8277d48-383d-42a7-9771-029834d3907c","resolution":{"observed_at":"2026-07-11T15:23:22.681709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-11T07:04:37.865482Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05390","last_updated":"2026-07-06T17:59:18Z","snapshot_observed_at":"2026-07-11T07:04:37.280553Z","submitted_at":"2026-07-06T17:59:18Z","title":"Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T07:04:37.865482Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.05390"},"observation_digest":"sha256:c3b3945930247adad30aa95af8c9f938d5840ac5d5772303d09df7a694369337","observation_id":"0c660030-abd4-41db-ab64-750e25cad946","resolution":{"observed_at":"2026-07-11T07:04:37.865482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-02T01:10:30.250974Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:4a7b30b78f91ce5cbc91e7fc6028fe78473e2600189be6be867209fb9213260e","observation_id":"aa4ea3b1-c690-484e-a86f-6a14c1f70746","resolution":{"observed_at":"2026-07-10T00:26:39.639035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2607.08763","last_updated":"2026-07-09T17:58:29Z","snapshot_observed_at":"2026-08-05T16:08:05.447561Z","submitted_at":"2026-07-09T17:58:29Z","title":"OpenCoF: Learning to Reason Through Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:37.265723Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.08763"},"observation_digest":"sha256:79977c2b98696cad8a707d72b0c5de67a30019157a5143e8153ad8b6211a23cc","observation_id":"8657b9ef-67e8-4500-a5f8-38582f8953d2","resolution":{"observed_at":"2026-07-10T01:46:40.972750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2509.20328 (2025) 4, 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-03T20:31:54.523048Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:6d141994066dbae0af4e4f3f5958639d3701f51d36a3884f8c7140d4a26c5593","observation_id":"8e37c9d8-47b1-4b2e-aff0-3e4f726cd7f5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-02T02:52:18.530088Z","title":"Wiedemer, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14076","last_updated":"2026-07-15T17:48:48Z","snapshot_observed_at":"2026-08-02T02:52:11.633120Z","submitted_at":"2026-07-15T17:48:48Z","title":"From Pixels to States: Rethinking Interactive World Models as Game Engines","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T02:52:18.530088Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.14076"},"observation_digest":"sha256:558345f0b4801fd1029645967db255f0ac3fa54cdf7bf8e7314edba3e2094fca","observation_id":"cb1be0d7-326c-4df3-92ca-1544e8a006fb","resolution":{"observed_at":"2026-08-02T02:52:18.530088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T22:40:12.822532Z","title":"Video models are zero-shot learners and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16351","last_updated":"2026-07-17T06:20:20Z","snapshot_observed_at":"2026-08-04T12:29:15.173256Z","submitted_at":"2026-07-17T06:20:20Z","title":"Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:40:12.822532Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.16351"},"observation_digest":"sha256:8b0a6f387141b52eb23978819bf2752351dcd8fe05f771fadb41a85332285491","observation_id":"8c482106-cb9a-469d-9c97-c392dce55833","resolution":{"observed_at":"2026-08-01T22:40:12.822532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T21:07:27.838962Z","title":"Video models are zero-shot learners and reasoners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16401","last_updated":"2026-07-17T18:00:05Z","snapshot_observed_at":"2026-08-02T23:36:27.285941Z","submitted_at":"2026-07-17T18:00:05Z","title":"Apple-$\\pi$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:27.838962Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.16401"},"observation_digest":"sha256:1f23b8c5c25e4ad7b0ab4109214980f65ffd64912032d5ee9da05f87ddb76f44","observation_id":"6792c75c-d84d-4134-b62d-4259ad71952f","resolution":{"observed_at":"2026-08-01T21:07:27.838962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T18:33:06.207028Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17279","last_updated":"2026-07-19T14:52:31Z","snapshot_observed_at":"2026-08-01T18:33:02.333809Z","submitted_at":"2026-07-19T14:52:31Z","title":"Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:06.207028Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.17279"},"observation_digest":"sha256:69c2ad94611acab5114d262b982e7f72f1b6a92ab42ce79e24b50ae47f780e45","observation_id":"3250ba63-0662-4c3d-a75d-c3d83c42d811","resolution":{"observed_at":"2026-08-01T18:33:06.207028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T11:24:29.782087Z","title":"Wiedemer, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19919","last_updated":"2026-07-22T08:50:40Z","snapshot_observed_at":"2026-08-02T12:24:58.302184Z","submitted_at":"2026-07-22T08:50:40Z","title":"Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:24:29.782087Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.19919"},"observation_digest":"sha256:94421f6823764ee5494b28735bef29776dc44616be86869abbc41ddd684342d5","observation_id":"127f1619-a1a4-436b-bd5c-7b1487b9bdc1","resolution":{"observed_at":"2026-08-01T11:24:29.782087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-31T20:13:33.415740Z","title":"Video models are zero-shot learners and reasoners.arXiv preprint arXiv:2509.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24241","last_updated":"2026-07-29T07:34:35Z","snapshot_observed_at":"2026-08-03T19:49:19.909371Z","submitted_at":"2026-07-27T10:20:31Z","title":"FilmBench: A Film-Grade Benchmark for Cinematic Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T20:13:33.415740Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.24241"},"observation_digest":"sha256:f9bd67c5003e9594dffc1ec4b24dba94d59941918520435a3ad76b784715deee","observation_id":"9846cd65-116c-4b57-9aa4-0b11093d535f","resolution":{"observed_at":"2026-07-31T20:13:33.415740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T02:13:11.573564Z","title":"Video models are zero-shot learners and reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.573564Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2f4db488b27db6169814f9ab0030a7de4590ae2538c572473ed4fbf42bdef3da","observation_id":"0654ae9d-0209-4ca9-b583-f60db8edc336","resolution":{"observed_at":"2026-08-01T02:13:11.573564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-30T20:12:49.623361Z","title":"arXiv preprint arXiv:2509.20328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26818","last_updated":"2026-07-29T12:13:01Z","snapshot_observed_at":"2026-08-04T14:27:57.724736Z","submitted_at":"2026-07-29T12:13:01Z","title":"Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-30T20:12:49.623361Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.26818"},"observation_digest":"sha256:522ea9da423783798e253b4cff9a33a487da3782d2dec1e253dcc7a6ecfea03f","observation_id":"6bf596d3-03c3-4ea5-b621-d9e868882fec","resolution":{"observed_at":"2026-07-30T20:12:49.623361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T04:59:38.639705Z","title":"Wiedemer, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27599","last_updated":"2026-07-30T02:41:52Z","snapshot_observed_at":"2026-08-02T23:35:37.976035Z","submitted_at":"2026-07-30T02:41:52Z","title":"World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T04:59:38.639705Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.27599"},"observation_digest":"sha256:1104827e3723328075bd87ae72d63d720b83a63cf1c42ca2b09791f74de160c1","observation_id":"06ddc16a-919d-4051-9d31-01dab965ebab","resolution":{"observed_at":"2026-08-01T04:59:38.639705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.20328/citation-record","integrity":"/paper/2509.20328/integrity","json":"/paper/2509.20328/citation-record.json","paper":"/paper/2509.20328"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":"2406.00515","doi":"10.48550/arxiv.2406.00515","metadata_source":"pith","pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Large Language Models for Code Generation","venue":"cs.CL","work_id":"7d829146-3160-44c7-9ce4-4201ed9b654c","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:0b4727da92d87c4322fc0bba6173048809bfc995533f34bf073031afd5a5e2f6","observation_id":"bef73ba4-bf2d-41db-8f33-085b65e67f4f","resolution":{"observed_at":"2026-05-14T02:16:45.828955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:49:11.204487+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:49:11.204487+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:efeca048e3106da7e114014034ce95c8e110f8e597580856b39030a1dac3a367","observation_id":"4f41cd84-640e-4566-b877-8b0cad30b2a1","resolution":{"observed_at":"2026-05-14T02:16:45.630561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17268","last_updated":"2024-01-30T18:58:43Z","snapshot_observed_at":"2026-08-02T10:06:29.155418Z","submitted_at":"2024-01-30T18:58:43Z","title":"Weaver: Foundation Models for Creative Writing","version":1},"cited_work":{"arxiv_id":"2401.17268","doi":"10.48550/arxiv.2401.17268","metadata_source":"pith","pith_arxiv_id":"2401.17268","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Weaver: Foundation models for creative writing","venue":"cs.CL","work_id":"1d3d18bc-fb96-451d-b2e5-aec2c15eb603","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2401.17268","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:5f9cf9d537404f5f6c8052fd20318572004a4721d577b243691878b818168b6b","observation_id":"70f7216d-28ca-4688-ad18-9e2d03da39b4","resolution":{"observed_at":"2026-05-14T02:16:45.686151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04675","last_updated":"2024-06-14T11:40:52Z","snapshot_observed_at":"2026-07-06T15:14:02.615465Z","submitted_at":"2023-04-10T15:51:30Z","title":"Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis","version":4},"cited_work":{"arxiv_id":"2304.04675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.04675","snapshot_observed_at":"2026-07-04T08:29:41.917678Z","title":"Multilingual machine translation with large language models: Empirical results and analysis","venue":null,"work_id":"8aedba3a-0fa4-4db0-94b7-ed63580404df","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2304.04675","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:5cd85d90ad4dad238cba0d7a78437a03185a33371437a92ad03157ed2b230dbf","observation_id":"33061bc7-b30a-4fc4-bdee-440561bd778b","resolution":{"observed_at":"2026-05-14T02:16:45.707178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":"2408.06292","doi":"10.48550/arxiv.2408.06292","metadata_source":"pith","pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","venue":"cs.AI","work_id":"56b6b58d-e73a-4317-896e-36ac5f84e957","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:61222a6bee011d3bac0f167ec1876009facd91c30fd63a702a2041de48b848c8","observation_id":"1f8e1a78-c68f-4e95-adc5-ac257f4defc3","resolution":{"observed_at":"2026-05-14T02:16:45.758015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:20.611352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:20.611352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04227","last_updated":"2025-06-17T16:19:14Z","snapshot_observed_at":"2026-08-03T03:40:06.947021Z","submitted_at":"2025-01-08T01:58:42Z","title":"Agent Laboratory: Using LLM Agents as Research Assistants","version":2},"cited_work":{"arxiv_id":"2501.04227","doi":"10.48550/arxiv.2501.04227","metadata_source":"pith","pith_arxiv_id":"2501.04227","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Laboratory: Using LLM Agents as Research Assistants","venue":"cs.HC","work_id":"cb6e0bd7-2f2d-4052-875a-985ba5600340","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2501.04227","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:113f40cc7381ce1075e3e4ea1cf5715155b8bf0566f12ae287d0668e8715d96f","observation_id":"1e4b0727-f9e6-4e01-ace3-8b1d8e75b720","resolution":{"observed_at":"2026-05-17T04:05:19.002260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:20.272963+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:20.272963+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.332055Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"bd7ec542-9242-446e-955e-bb75e729be5d","year":1901},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:f0b3d3c0f74892e725a04f853c38da4de1b08c48e7a195f63e8534894f7c0fb8","observation_id":"f01a4d9f-b346-4837-a3ad-f958976b4d7e","resolution":{"observed_at":"2026-05-14T02:16:45.945383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:78b7c86897db694cead0c928e073a2441cb906f1b2157cc0d2e3c44a5d0fb4f2","observation_id":"348889bd-e45a-4be7-be25-ee6416d71be5","resolution":{"observed_at":"2026-05-14T02:16:45.636483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":"2301.00234","doi":"10.48550/arxiv.2301.00234","metadata_source":"pith","pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on In-context Learning","venue":"cs.CL","work_id":"864701ca-cb36-4a91-9be8-e2b9b20679aa","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:5c4dd40a5d1fe5a0246dd507ba9b65367bd2ae588e7c376dfd2602393e830c83","observation_id":"ef3203b8-916f-402c-b6dd-615aa45ae9b8","resolution":{"observed_at":"2026-05-14T02:16:45.660933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35: 22199–22213","venue":null,"work_id":"f69f3f9c-f092-49b0-b244-16b6480f5a02","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:892957d67336e5a824a5ed67684ca4e56d9551f4be7930213e966b95960f6afc","observation_id":"a12b7684-345e-4894-930a-8cb96a6a7e17","resolution":{"observed_at":"2026-05-14T02:16:45.949791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.204657Z","title":"Segment anything","venue":null,"work_id":"ccc0c322-2f90-4398-aaac-1d329cfcf543","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:55efc64f9823b25b048ac2e9e40a251f635618ecf475ff8c933af79a782e7616","observation_id":"07e10f6a-0a33-436b-8da5-831d03b9d893","resolution":{"observed_at":"2026-05-14T02:16:45.953874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:54fefc3b3a9569bfc678e6451868b13260d4c4255fbfa2951cda14439100e20f","observation_id":"31b2fcc2-bc71-4d27-a17d-8578eacd7d05","resolution":{"observed_at":"2026-05-14T02:16:45.736064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:55:02.953254Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":"17247f7a-a050-42a1-9b08-983ccc261910","year":2016},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:dd5bba742cead0478818a00984f9a2416df7806752d0d0fa1744cf30f988e85e","observation_id":"6e7e27cb-928d-4b5a-a0ac-b0f675908781","resolution":{"observed_at":"2026-05-14T02:16:45.957495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":"2410.17725","doi":"10.48550/arxiv.2410.17725","metadata_source":"pith","pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","venue":"cs.CV","work_id":"17e84c13-a2a4-4b25-9b05-ca4ca212abfa","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:061bc94a6edd7e87aa1f1357093bdce5ca0a6a092b18015f65a51712c75c7c26","observation_id":"599fb6f1-94b3-435c-aaf5-cf4dcb48c2cc","resolution":{"observed_at":"2026-05-14T02:16:45.782899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07280","last_updated":"2025-06-10T11:37:10Z","snapshot_observed_at":"2026-07-06T21:38:44.739873Z","submitted_at":"2025-06-08T20:52:34Z","title":"From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.07280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07280","snapshot_observed_at":"2026-07-03T10:07:55.884435Z","title":"From generation to generalization: Emergent few-shot learning in video diffusion models","venue":null,"work_id":"3439d19e-44bb-4d6a-9260-36135e5cb358","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2506.07280","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:ebd347cfb47f5ef60d6389569face4fd9a5c49337cdc0d8d7a5a5b606e1e4020","observation_id":"88ce5459-4164-4a44-985c-3275a995d336","resolution":{"observed_at":"2026-05-14T02:16:45.793856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taskonomy: Disentangling task transfer learning","venue":null,"work_id":"8712f823-f837-433d-8bc7-a510ca7331ff","year":2018},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:cbafcbf657a4458ef5424f1258e0fff354ed22e61df5f7171e6cb822ed7e59ac","observation_id":"6db6f449-ee4c-4925-96a1-26781f0063bc","resolution":{"observed_at":"2026-05-14T02:16:45.961504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10406","last_updated":"2025-07-20T08:44:35Z","snapshot_observed_at":"2026-07-06T20:52:04.228632Z","submitted_at":"2025-03-13T14:31:52Z","title":"RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models","version":2},"cited_work":{"arxiv_id":"2503.10406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realgeneral: Unifying visual generation via temporal in-context learning with video models","venue":null,"work_id":"aacb92b4-9e9f-4d8d-8494-e2add99564f3","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2503.10406","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:303a369214c4c6d423bd9dec071cc6624b02db6101b7327bf8d46e7cf0027c81","observation_id":"cb05e227-021d-4edc-b7b1-623258346c5a","resolution":{"observed_at":"2026-05-14T02:16:45.816914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:42.927761Z","title":"Visualcloze: A universal image generation framework via visual in-context learning","venue":null,"work_id":"830052c8-5a23-443f-b99f-56edcac4ef03","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:73dc8dd6d022898f8c8e3dfbb168418317ccda98a7afbab08743ccad1c5766fd","observation_id":"296b9fa4-276c-4e55-9db6-add78bb5826a","resolution":{"observed_at":"2026-05-14T02:16:45.824763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"5ba55ce1-d629-4790-9a72-6cac7c74d338","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:c3a9222034e43fe5d8214bb9096abe4216e7c7e6732ab01afd17a6b4f7ea22da","observation_id":"ae17744b-1166-4a7c-b573-310a46abdc7b","resolution":{"observed_at":"2026-05-14T02:16:45.965080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Test- time visual in-context tuning","venue":null,"work_id":"cbaf3628-b2c9-4d33-b37b-5d3c857bb41d","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:92baac100af3ce705c2694a80f7ba28f844716c7e7bf41fce2a35f04d750eaac","observation_id":"02ae06f0-e66e-4bea-9b6e-cb5f3c7669ab","resolution":{"observed_at":"2026-05-14T02:16:45.968994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15278","last_updated":"2025-02-27T10:18:59Z","snapshot_observed_at":"2026-08-03T10:43:37.072174Z","submitted_at":"2024-09-23T17:59:46Z","title":"PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions","version":4},"cited_work":{"arxiv_id":"2409.15278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15278","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixwizard: Versatile image-to-image visual assis- 15 tant with open-language instructions","venue":null,"work_id":"c76740a0-cf0c-4155-ae14-27d3c90e82ec","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2409.15278","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:08434ddc0f61b64a0f2e5b58d9bd75f51700547cf012f05368e66be04c298111","observation_id":"e9fd3736-1373-466c-bc23-fbf9e0aba84c","resolution":{"observed_at":"2026-05-14T02:16:45.643098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.883191Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"9bd3f0a2-4735-491c-a256-4b77e6855701","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:e5ad0084820051bd245f3694e6c6f779e8eba05294da3d2edb351ebb803f797e","observation_id":"b3e254ba-791e-47a7-9ea8-d5cb42603a52","resolution":{"observed_at":"2026-05-14T02:16:45.972880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One diffusion to generate them all","venue":null,"work_id":"8a2f2437-3165-4420-9caf-7e6905649874","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:b73e01a76f42937bbd2866710eefe0becafa273582ae5bd32eac2f6bf879baa3","observation_id":"c66a504e-7a54-40b2-9460-8134ed831263","resolution":{"observed_at":"2026-05-14T02:16:45.976845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":"2302.01329","doi":"10.48550/arxiv.2302.01329","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2302.01329 , year=","venue":"arXiv (Cornell University)","work_id":"ca67528e-7a41-4d0b-b2ac-92f36aaacc4f","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:9faa4e698b476cff87e44eb3a0582b8607225db7783c50bc90ad31154c58ca3d","observation_id":"cc555498-692d-46d6-8300-b1e47755234d","resolution":{"observed_at":"2026-05-14T02:16:45.692914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalingproperties of diffusion models for perceptual tasks","venue":null,"work_id":"f49c7ea7-b4b6-4618-b241-66e611abb0e3","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:4ffed60037a3b211b9e1561b8b36d6abaae43c8ee13305e77de2d7064c760819","observation_id":"c4cebdcd-5d64-4fac-b9bd-0e9abc855778","resolution":{"observed_at":"2026-05-14T02:16:45.980114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":"2402.17139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-07-02T23:57:27.914181Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":"c0c521da-9575-4981-98c6-a569fbccab98","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:bfbefa201ce26bbcb4aaa2724ab7db0fa3e20904aad5b61aa2ccf9275e573abb","observation_id":"4a4b10f8-090a-45da-8050-70aa98552be8","resolution":{"observed_at":"2026-05-14T02:16:45.722401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.941805Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837","venue":null,"work_id":"3256b5a6-76d9-460c-ad77-5d232058ad6d","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:d09ffe7755611295aa58a903ccef1ca4eb89326dc547c8908a1eb20a2ca81034","observation_id":"b033b0c7-d2a0-4392-960a-97a413181f01","resolution":{"observed_at":"2026-05-14T02:16:45.984159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are human-level prompt engineers","venue":null,"work_id":"aac263ff-ed0a-4b73-93fb-a970e22bbd02","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:0c0d32890dfa3e940fc26994ee1e64069a632428aa95aadee330bb869c505edb","observation_id":"4edf34c7-13a5-44d1-8391-472090970482","resolution":{"observed_at":"2026-05-14T02:16:45.996125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:17.841793Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing.ACM computing surveys, 55(9):1–35","venue":null,"work_id":"f23753d8-01f1-43af-8fb1-3940438032ce","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:4e8cd9c06855034874a409c80b698d22d2e1f2fc10b8e05bca5474f8430450ac","observation_id":"56fcc7f1-f44a-42d9-93c1-8b4f9da2b148","resolution":{"observed_at":"2026-05-14T02:16:46.001183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vertex AI Veo Prompt Rewriter.https://cloud.google.com/vertex-ai/ generative-ai/docs/video/turn-the-prompt-rewriter-off#prompt-rewriter","venue":null,"work_id":"74185ff8-c59f-42ed-809e-0bddc9090f4a","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:94a8b6cd682da0cfb7006b3615f8bd030561a03082e689d7bc7596b6ee2cf0a9","observation_id":"abbdbd02-e4b8-4427-b500-ab4bafa21be2","resolution":{"observed_at":"2026-05-14T02:16:46.005034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bdaece07-d9d6-4040-bdac-350a53c5b402","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:3caa97a2f9390eae6f4949df461a39d3a393838835389f950094fe8748750d64","observation_id":"d24e5fc7-f1b8-4028-9193-a70fe8262488","resolution":{"observed_at":"2026-05-14T02:16:46.008932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmsys org text-to-video leaderboard.https://lmarena.ai/leaderboard/t ext-to-video, September 2025","venue":null,"work_id":"b21a8430-2ef1-4d9a-8f6e-d297dc454965","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:62ea74e2081930d8d2f22decb0c163e00ccbecad38b688bc9ea9d4039f68e591","observation_id":"28ab6dec-88e1-475e-8054-73ef29444676","resolution":{"observed_at":"2026-05-14T02:16:46.013734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 2 announcement.https://blog.google/technology/google-labs/vide o-image-generation-update-december-2024/","venue":null,"work_id":"3a236670-83cc-4adc-a7d2-db6a2f061b1c","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:346470c189bc9d5431725eaae005d555ebb9fb170008ffc123935cac42c63921","observation_id":"8376f9d4-3c43-4aba-a2c3-94e1c960dc6d","resolution":{"observed_at":"2026-05-14T02:16:46.016928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 2 launch.https://developers.googleblog.com/en/veo-2-video-gen eration-now-generally-available/","venue":null,"work_id":"c819c894-b137-474f-89b1-8c6f15e6547c","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:a875490fbdef85d034645a4617077dfeeb913e22d12d581aa29495a89d4053fc","observation_id":"909cac90-fa50-496e-b8b9-e400b1cc3e07","resolution":{"observed_at":"2026-05-14T02:16:46.020541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3 announcement.https://blog.google/technology/ai/generative-m edia-models-io-2025/","venue":null,"work_id":"84cba4f8-97e4-4edf-9c02-b5b1f28e6c4f","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:c779178d62c9bfcc8ad5335c77d93928bfa5e7e7eb0be45e0c93096b60f41d5f","observation_id":"6954cf1d-45d1-4eeb-ae65-5546e6d0dbe1","resolution":{"observed_at":"2026-05-14T02:16:46.024333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3 launch","venue":null,"work_id":"22cf49de-7697-4600-9c47-4a3fecc8545c","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:a4ca5049f467078acf508bf49089e819a4d823795b53371e9aca9b78f67b3517","observation_id":"ae0d721a-5a0d-48e1-b0cd-12dad6264034","resolution":{"observed_at":"2026-05-14T02:16:46.028191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistically-nested edge detection","venue":null,"work_id":"66d21b10-e194-4633-aa4c-4df5b1797672","year":2015},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:277cbc2492689810bd82bf07ef472d8999e0f8e2eaec2449c533bcf6c43d3341","observation_id":"83e868e0-cbe2-4cd9-9898-a5030c80e7c3","resolution":{"observed_at":"2026-05-14T02:16:46.031839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-01T11:20:53.002295Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":"1803.07616","doi":"10.48550/arxiv.1803.07616","metadata_source":"arxiv_reference","pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rodriguez, J","venue":"arXiv (Cornell University)","work_id":"d53bffe7-b38d-42b7-8c9f-70c89156ba20","year":2018},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:66483eb0b871f714b5b0a5eb0b360d7046e80038c268132b776909479bc78240","observation_id":"662da419-d5dc-44b8-90e1-60a2fc0f1461","resolution":{"observed_at":"2026-05-14T02:16:45.673040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bear, Elias Wang, Damian Mrowca, Felix J","venue":null,"work_id":"efa5d1db-0bad-4830-999c-e0fbc6f02c1e","year":2021},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:5384482ed2a90198fcebf0f979131d6647cc8028902786d7bfdac42d73db9db5","observation_id":"71f277fe-c5d9-4842-a170-1f6c587c8070","resolution":{"observed_at":"2026-05-14T02:16:46.035489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking progress to infant-level physical reasoning in ai","venue":null,"work_id":"fcc153b0-5700-41eb-8129-e80613bd6240","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:e05191d866e2248ca65116f0ce09d6902107d49d57d7f2f499385b9429c5ac65","observation_id":"6f0f6882-7402-49be-a0c9-578581e2ce98","resolution":{"observed_at":"2026-05-14T02:16:46.039510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09048","last_updated":"2024-06-06T09:35:53Z","snapshot_observed_at":"2026-08-03T06:31:16.052094Z","submitted_at":"2023-11-15T15:38:28Z","title":"GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models","version":3},"cited_work":{"arxiv_id":"2311.09048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09048","snapshot_observed_at":"2026-06-29T17:33:45.014788Z","title":"Kang, B., Yue, Y ., Lu, R., Lin, Z., Zhao, Y ., Wang, K., Huang, G., and Feng, J","venue":null,"work_id":"ca34da26-5874-423d-a3ef-d5ced1287ec9","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2311.09048","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:b52c60d82c8a5403817a74679d38723e494164e967ecb02658c7caf086ce3c64","observation_id":"e67d384f-5157-445e-8efd-cab7b1cd49a2","resolution":{"observed_at":"2026-05-14T02:16:45.697614Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physion++: Evaluating physical scene understanding that requires online inference of different physical properties.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"26e52c3d-04e8-47ef-a4c9-ea7e985cf5d6","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:deca63f41478a366ac0031785de99daf1f185b6152a495ceb8c48736c847e5a1","observation_id":"88cbd2c3-72a9-4dc1-b803-bc9136d59245","resolution":{"observed_at":"2026-05-14T02:16:46.043452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videophy: Evaluating physical commonsense for video generation","venue":null,"work_id":"a5d53960-fc35-410d-9b38-c3115a04dbf1","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:7484971ac09d99df184fa7e4398c76ab68cd30ef02b913440df7d8cb0e5bc48e","observation_id":"d4da3c3e-8496-43bd-8189-9107dfec051c","resolution":{"observed_at":"2026-05-14T02:16:46.047617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08027","last_updated":"2026-04-23T21:02:30Z","snapshot_observed_at":"2026-07-30T08:49:18.908938Z","submitted_at":"2024-11-12T18:56:58Z","title":"LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines","version":3},"cited_work":{"arxiv_id":"2411.08027","doi":"10.48550/arxiv.2411.08027","metadata_source":"pith","pith_arxiv_id":"2411.08027","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines","venue":"cs.LG","work_id":"0c14a600-1adb-4c1e-915e-1f7f5605d4b0","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2411.08027","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:c2ad46dfeb17078cc20af1bf3eb6ec243417e1100a6d595957c0dc8fe19c61c6","observation_id":"0bb14a58-a96f-4d6b-b8f7-35fef17abfa4","resolution":{"observed_at":"2026-05-14T02:16:45.732601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards world simulator: Crafting physical commonsense- based benchmark for video generation","venue":null,"work_id":"796422fe-c41b-4bf8-896a-3ed796ee0493","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:63a3b196fe4ca9fd3435c780fcea1c04ad2fc878513691d35530c8e52d5bbc4a","observation_id":"67e73ec4-8a3f-4025-a1c0-ba330521b86e","resolution":{"observed_at":"2026-05-14T02:16:46.051461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":"2411.02385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-07-08T07:14:45.230404Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","venue":"cs.CV","work_id":"4459ec7e-7a67-4b25-9c04-e91d87bf1b63","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:097baa7f81c9cdc4772a3982acace3fc77e0083f31d8ae2e10edb863ff7ec516","observation_id":"b46f4546-d677-490e-88a4-123891b1c737","resolution":{"observed_at":"2026-05-20T11:13:41.491170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":"2501.09038","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-07-07T15:43:53.802817Z","title":"Do generative video models understand physical principles?","venue":"cs.CV","work_id":"d9132ccf-02ed-4700-bf79-4e874794600d","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2763d137097898234976beec1a2a037d9699108147998fb979677236182bb3d3","observation_id":"11174655-76a8-4901-8b29-a845e33e090a","resolution":{"observed_at":"2026-05-20T12:47:06.031259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-07-06T20:22:59.218985Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"cited_work":{"arxiv_id":"2501.10928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10928","snapshot_observed_at":"2026-07-04T13:19:51.110536Z","title":"Generative physical AI in vision: A survey","venue":null,"work_id":"34f60193-442f-42cd-9108-74cfa8af09e6","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2501.10928","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:9befde8ba9e8e089cfa46f5dfd061bd14bc71c101e3e6b0dbcc95303ad6ecc01","observation_id":"658d0d9f-56e1-443c-aea4-d5a136be12ee","resolution":{"observed_at":"2026-05-14T02:16:45.752438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual cognition in multimodal large language models.Nature Machine Intelligence, pages 1–11","venue":null,"work_id":"a712a1e7-042b-40da-9a96-b864dd690e83","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:4fd4aa68a779caf8f95a576724deb53f4ca1d6a84c04d2394773fb66e8dafbcd","observation_id":"cd3b184b-2f2c-4dc2-b44e-bb5f7f648a13","resolution":{"observed_at":"2026-05-14T02:16:46.055526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02918","last_updated":"2026-06-29T01:14:54Z","snapshot_observed_at":"2026-07-06T21:03:55.628788Z","submitted_at":"2025-04-03T15:21:17Z","title":"Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems","version":3},"cited_work":{"arxiv_id":"2504.02918","doi":"10.48550/arxiv.2504.02918","metadata_source":"pith","pith_arxiv_id":"2504.02918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhang, D","venue":"cs.CV","work_id":"a5729cf7-9ce0-49a1-a57d-9886470c40b7","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2504.02918","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:7ff065735fc698e08aeef4d136c3ac27121ba28970766bc244044fba2e7a8a23","observation_id":"f958c9a8-4a82-449e-bf1f-b2406c8a9c42","resolution":{"observed_at":"2026-06-30T03:17:04.940243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:48.706484+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:48.706484+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11831","last_updated":"2025-02-17T14:27:14Z","snapshot_observed_at":"2026-08-04T07:30:58.893758Z","submitted_at":"2025-02-17T14:27:14Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","version":1},"cited_work":{"arxiv_id":"2502.11831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11831","snapshot_observed_at":"2026-07-04T15:49:58.028816Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos.arXiv preprint arXiv:2502.11831","venue":null,"work_id":"e57b6325-f361-44d2-86e0-dcb7cf4e46dd","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2502.11831","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2401034b9049ebc158f7d1230d843a818e1f0b4cd893d3c9a14189e378b788ce","observation_id":"69a5a721-c0c7-4f28-9e95-6fb80f7ebe5c","resolution":{"observed_at":"2026-05-14T02:16:45.772679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21770","last_updated":"2025-03-27T17:59:33Z","snapshot_observed_at":"2026-07-06T20:59:49.523414Z","submitted_at":"2025-03-27T17:59:33Z","title":"Visual Jenga: Discovering Object Dependencies via Counterfactual Inpainting","version":1},"cited_work":{"arxiv_id":"2503.21770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21770","snapshot_observed_at":"2026-06-28T19:32:34.724258Z","title":"Visual Jenga: Discovering Object Dependencies via Counterfactual Inpainting","venue":null,"work_id":"0cbf5c2c-76ca-4283-bd7e-ab9252f14a18","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2503.21770","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2101c5a31d0a1f5f646d587647419d336a214921d62add45adb7ef3e30382b79","observation_id":"92c33d57-4426-4dd7-aaa5-6de33846f577","resolution":{"observed_at":"2026-05-14T02:16:45.778635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.607803Z","title":"Human-level concept learning through probabilistic program induction.Science, 350(6266):1332–1338","venue":null,"work_id":"29231825-17b7-4296-8a0d-1902285f1f52","year":2015},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:902cf48d9e4a1f7a93f2a385d49d61af153b5e84eaa502c8711f3daa2430d590","observation_id":"c478925f-bc14-4f6d-8c21-88a2922abdb7","resolution":{"observed_at":"2026-05-14T02:16:46.059600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:8fcf0527deafc06ed831d0955c4f3e0bf851a4a5745ca3e98613d747db188f8a","observation_id":"96208e04-2720-4f38-9ca4-5006ef5ab42c","resolution":{"observed_at":"2026-05-14T02:16:45.787940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nano Banana: Gemini Image Generation Overview.https://gemini.google/ov erview/image-generation/","venue":null,"work_id":"a2b8a2c6-5fe1-416e-824d-ce70c839234d","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:7390c7042d63ce9c542dc3a35a0d54cb03e417adcb48026a39b4a211f2289ea4","observation_id":"04c05d67-43d5-4323-94cd-b5b60de22f9b","resolution":{"observed_at":"2026-05-14T02:16:46.065188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-to-image diffusion models are zero shot classifiers.Advances in Neural Information Processing Systems, 36:58921–58937","venue":null,"work_id":"b77bf7d6-d44e-4908-8e71-1e9b820ac129","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:951be2f49c190fba1f6a152139d9a06d462877b104a6e4a6bdc4345a1ffadc12","observation_id":"819c2c9b-35fe-4b93-ba1e-7ad3611949f1","resolution":{"observed_at":"2026-05-14T02:16:46.068567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intriguing properties of generative classifiers","venue":null,"work_id":"54266c0d-bf48-4c4d-9924-d02cafc7874e","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:15e8a4c378d20975897dbfb3a0adb3494fd9a40907295668dc657f6f6ad1b7b9","observation_id":"cc1b3590-b6be-4fa7-9507-ff61347bde4f","resolution":{"observed_at":"2026-05-14T02:16:46.072441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13224","last_updated":"2023-06-21T12:35:16Z","snapshot_observed_at":"2026-08-04T12:38:26.591665Z","submitted_at":"2022-11-23T18:59:05Z","title":"Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors","version":2},"cited_work":{"arxiv_id":"2211.13224","doi":"10.48550/arxiv.2211.13224","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.13224","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"year =","venue":"arXiv (Cornell University)","work_id":"cbbafd3d-cd62-45ff-b284-3cf7fd569d2b","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2211.13224","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:4b53c7113a9a5895c628f620a3d27706a0253011282ae5a2dc01b7be103e86fb","observation_id":"d0b8f05f-29c6-4fde-828f-30cdf38962e9","resolution":{"observed_at":"2026-05-14T02:16:45.821415Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":"fca8e6ec-5fca-4dc8-a99b-f44b54c471b6","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:6fd9fb13dd390ca19ec5a307eac764746fc07b1310a0a11d08e43d47b548fb3a","observation_id":"c52699cf-9069-4241-a370-53baac5fbf99","resolution":{"observed_at":"2026-05-14T02:16:46.075862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense extreme inception network: Towards a robust CNN model for edge detection","venue":null,"work_id":"c294ed8c-3b6a-4245-ad32-a626e535ecd3","year":2020},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:6b5e30ed4c27c0721eb1297531a2579ec55b04924e726000c0154ce7c6ff9cfc","observation_id":"5d6a7d5a-7fb4-475c-a741-d2b810d252b4","resolution":{"observed_at":"2026-05-14T02:16:46.080483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.109461","doi":"10.1016/j.patcog.2023.109461","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dense extreme inception network for edge detection.Pattern Recognition, 139:109461","venue":"Pattern Recognition","work_id":"1959eb49-63c8-4ab8-b0ba-5ec9e9d195e2","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:fa064109411e3426a3ce2bd89c78c1937ff42375e76792cbf366be9c5d4d5c53","observation_id":"3048c93f-6aae-4f61-b8df-6a717a2cf6b6","resolution":{"observed_at":"2026-05-14T02:16:45.624252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"9c49017b-63c2-4b60-af84-17804264b8a2","year":2019},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:44eebf136da49b4216b29f21e292666de1f290e0f72e6fb139d2d80e35aa7ff9","observation_id":"66e36985-accc-4d25-b3eb-a604f46f84a8","resolution":{"observed_at":"2026-05-14T02:16:46.084493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.718232Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":"929420c3-fdff-4cf4-996d-371a67bedd6a","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:94ec2a824d53bfb3afad9dde58c476f77d58fee43b02f010dc19d3206412eb39","observation_id":"90b5de49-3b14-4f96-be59-40327be201fc","resolution":{"observed_at":"2026-05-14T02:16:46.088704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07111","last_updated":"2024-06-26T04:58:39Z","snapshot_observed_at":"2026-07-06T18:43:51.723237Z","submitted_at":"2024-06-26T04:58:39Z","title":"Diffusion Model-Based Video Editing: A Survey","version":1},"cited_work":{"arxiv_id":"2407.07111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07111","snapshot_observed_at":"2026-07-04T03:29:29.539815Z","title":"Diffusion model-based video editing: A survey","venue":null,"work_id":"863e4945-5bd6-4521-957f-2ab931bb18df","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2407.07111","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:da27b6051b099dd3f22ed099d13691a9e72d4eacd243c908df2b87418a1013b1","observation_id":"85e9d970-c35b-4f80-8a49-45453bb18c8a","resolution":{"observed_at":"2026-05-14T02:16:45.649401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VEGGIE: instructional editing and reasoning video concepts with grounded generation","venue":null,"work_id":"e38d3426-0735-4e5b-914f-57d065901535","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:92b4059fa24c87e4265363a834467a44b418d74647e891259605fdfa5f3e9bc1","observation_id":"e1cbb1d1-877c-44da-8271-f7955efe7489","resolution":{"observed_at":"2026-05-14T02:16:45.655323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pathways on the image manifold: Image editing via video generation","venue":null,"work_id":"153fdd91-8c53-4b0c-b1c6-91189b7ff0c0","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:eb938d9dc64e0bfc34a4fb9e3d1dd44154bee17ccadfee022bf8c1f122bb6fd4","observation_id":"7d99fe5e-b18c-43bb-a476-59b7987e8e6a","resolution":{"observed_at":"2026-05-14T02:16:46.092664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.17773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:07:39.114616Z","title":"Kiva: Kid-inspired visual analogies for testing large multimodal models","venue":null,"work_id":"95442b12-7b72-4e33-bac4-3d766b0c56d7","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:76e982d16d66aaf15274626c08540a8174176de4f9b54434f9233b936e562ef7","observation_id":"562bad6e-290e-434a-bb7f-6e19ffefdb60","resolution":{"observed_at":"2026-05-14T02:16:45.667062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ImageNet classification with deep convolutional neural networks.Advances in neural information processing systems, 25","venue":null,"work_id":"257bd31a-7bb8-43c4-ac59-16736de21405","year":2012},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:a54190c194d8e00f5216903ecf154c39597c1d26fba9180a50b00273c42bd46e","observation_id":"82df084a-7573-43b6-8f1a-caa524c8f283","resolution":{"observed_at":"2026-05-14T02:16:46.096756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-07-06T20:01:54.557848Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":"2412.03782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., Chan, S","venue":null,"work_id":"1637ccdd-28c6-43d8-972b-475a06dc17c3","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:ff58a31cb6a643e193148c44287c93bc7c8c7b73242980fe702e0670abaf8048","observation_id":"e5ac8b7b-b2a7-462c-b506-d6c6c3b849da","resolution":{"observed_at":"2026-05-14T02:16:45.679766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Performance vs","venue":null,"work_id":"58622e24-0516-48e8-b490-ad92c79c752f","year":2020},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:d638c6f90c70223e46fd8fec2faf8ea606f23c282d05ef32749eec04abbbc9be","observation_id":"19f0b701-2afd-4426-896c-e7054f8baa9e","resolution":{"observed_at":"2026-05-14T02:16:46.100499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.093155Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673","venue":null,"work_id":"845906b0-fce8-4839-bfe0-ea09b2a56000","year":2020},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:ef359e1aef2028b9bdece638d835408ea85ffdcf83296c82193f77e0b94bf09e","observation_id":"32f7ea35-5384-41ba-9d67-137c080d06f2","resolution":{"observed_at":"2026-05-14T02:16:46.104113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM inference prices have fallen rapidly but unequally across tasks, march 2025","venue":null,"work_id":"c8fd40d4-1f11-41dc-8161-b85d05f91674","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:d8616868d6841002a3f7c4f958ea8c231ff0176371b5c0ccb996b6619892c704","observation_id":"7b0824cf-c67a-4100-95d4-2fb9af23cecd","resolution":{"observed_at":"2026-05-14T02:16:45.832087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:8473253838637e82708c6cdc640c7d90c241c8d5b1dc67446167c778111789b9","observation_id":"df72a32f-a177-4c83-8b72-91c9b6d470e8","resolution":{"observed_at":"2026-05-14T02:16:45.702329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:20:46.851957Z","title":"Self-refine: Iterative refinement with self-feedback.Advances in Neural Information Processing Systems, 36:46534–46594","venue":null,"work_id":"cee7156e-51cc-4f15-a787-5dd8ec9097e5","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2b85e88f2c67d9f23feb4dc11a262658769fdb83447b8cacd0202c5938198939","observation_id":"e8623ba1-15bd-4c91-b129-e55e413cfbd1","resolution":{"observed_at":"2026-05-14T02:16:45.835856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:02e357d359349c84360e538e4ed5128143ef1a67d79dc22490fdbfe3e5e581d4","observation_id":"5bd3cd9d-904f-446a-a968-c1c1e5f1c99e","resolution":{"observed_at":"2026-05-14T02:16:45.711478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:032b8791ced796a312123488aba9866b74cd1d79f153d95800fb3369f151ed1b","observation_id":"c3da3f50-69ff-463b-9fb1-17618de2aa3e","resolution":{"observed_at":"2026-05-14T02:16:45.716616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35: 27730–27744","venue":null,"work_id":"50571296-9c68-49f0-a008-7becaa32a251","year":2022},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:ee2790a32e65b58c8417c5dc3f1ae34af8f0c9e80a1789fac2e79daa5359f2ea","observation_id":"8c1e15e0-3515-4b12-9dc9-f0a7d598cb99","resolution":{"observed_at":"2026-05-14T02:16:45.838946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":"2304.03277","doi":"10.48550/arxiv.2304.03277","metadata_source":"pith","pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction Tuning with GPT-4","venue":"cs.CL","work_id":"fd515477-f9f1-48aa-9feb-a3308e7656bb","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:79d3e80b4abdfc70a4b0aadab323696ae4ebd08e0e0b71f07e8c5197e9d41907","observation_id":"f1b08678-78a0-49f1-b3c5-0af7bc882d9c","resolution":{"observed_at":"2026-05-14T17:04:18.193148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse gradient regularized deep retinex network for robust low-light image enhancement.IEEE Transactions on Image Processing, 30:2072–2086","venue":null,"work_id":"18d4c1b7-3317-4a4e-a718-f3e0b22f2613","year":2072},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2c657c0e3ad0ca1e7febc0fe14f85fc8f803faad49bc7a33234854aca2bb0380","observation_id":"2490a2bf-1199-4680-b469-ec23e4abd2c4","resolution":{"observed_at":"2026-05-14T02:16:45.842507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Under- standing the limits of vision language models through the lens of the binding problem.Advances in Neural Information Processing Systems, 37:113436–113460","venue":null,"work_id":"4868e6f1-710d-432f-bd37-5d35b57fd9e0","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:83cf686a6478b5b32d13adcca5ebeb05bc5fa72d9b0b63656dcaece627d36db9","observation_id":"129d23ba-5da9-4787-a816-bca8f930feac","resolution":{"observed_at":"2026-05-14T02:16:45.846108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0c8ef033-f70f-42dd-83cb-897da3f785a2","year":1965},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:6a835aa64c9e5f7b10b9ab8dd24af716ab8f33afeaabdf9bc0ad76a6e0060a7a","observation_id":"57826310-2a63-4706-a644-d42444dbfa92","resolution":{"observed_at":"2026-05-14T02:16:45.849438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The intelligent eye","venue":null,"work_id":"191abec5-eefe-464a-bdac-b2606f42a41b","year":1970},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:4a6910adff6d9cca2450433eca74083de0bbba51c6a701117b9e8aa246a4dde1","observation_id":"b6c999c7-920d-4a66-8efc-081d7d7e94b2","resolution":{"observed_at":"2026-05-14T02:16:45.852676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":"a76e83f2-172f-4bbd-9113-f74284ea82c2","year":2019},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:bb1b3f572fe92ad4cc99404445fe03c389c75a2a473c74b18fa2c971d7d5789d","observation_id":"9c7b4fd0-bcc6-4d1c-b8be-2081d169ced8","resolution":{"observed_at":"2026-05-14T02:16:45.856289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objaverse-xl: A universe of 10m+ 3d objects.Advances in Neural Information Processing Systems, 36:35799–35813","venue":null,"work_id":"6d0b76a3-7e20-4f01-8669-01f8fcabe8a2","year":2023},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:1251edf50cd7f8744da2290016b586294b6fec44dbc2ed4a1c73e6aabffa7083","observation_id":"e2ea640d-bf28-41bb-a0b7-198814fce6af","resolution":{"observed_at":"2026-05-14T02:16:45.860867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":"1911.01547","doi":"10.1007/s11432-024-4231-5","metadata_source":"pith","pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Measure of Intelligence","venue":"cs.AI","work_id":"d8980a59-aa48-447b-8852-b7aca2b41b2c","year":2019},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:5aa3f3d10562927807ad4cd82f685f80acf904d4c9a464d4697faeadbfed5a5b","observation_id":"3540fdfa-a7d1-4c1c-8c83-db344f8fa203","resolution":{"observed_at":"2026-05-14T02:16:45.762658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick","venue":null,"work_id":"712d1cf9-c562-4e17-804e-56c02b8fa4e9","year":2013},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:c19f9269b628dc5b3f430b35894bc6eefff73e4e33007c6a0f983ea25d27c989","observation_id":"0117641c-90ad-48ed-9529-5ca00c388108","resolution":{"observed_at":"2026-05-14T02:16:45.866068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick","venue":null,"work_id":"4ad569c4-ce2f-45f1-b89a-af873596bf00","year":2014},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:a756307770f18561ac2e75cc95b61e51889d3e63bfe2abd9180f46ac40b38ec7","observation_id":"9dee6f10-07ab-47ed-90d3-c01d8328272c","resolution":{"observed_at":"2026-05-14T02:16:45.870013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick and Piotr Dollár","venue":null,"work_id":"98e6e7a8-88ce-4fae-9ab5-a326bb800cee","year":2014},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:68e9e6261afacf9811e85181f07e4cd5f678235876579e84880a54cb6da322ce","observation_id":"b2f09b07-9408-4916-9701-b83fc85fe857","resolution":{"observed_at":"2026-05-14T02:16:45.873460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superedge: Towards a generalization model for self-supervised edge detection.CoRR","venue":null,"work_id":"e10130b6-afea-4cc9-9ad4-eb1e4b0103ef","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:989cc6b1a3f91de66fe53f673ff237286f6cc9d50e8df47fd9bd042270888ecc","observation_id":"22148205-b5f1-43a3-98d7-96f2b2b93fc6","resolution":{"observed_at":"2026-05-14T02:16:45.877117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maze dataset.https://pypi.org/project/maze-dataset/0.3.4/","venue":null,"work_id":"83a04851-cfda-4548-a92f-0286de35b3a8","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:bfb9adf2bf4cad5f186d563ab850f675310bfac0f797299e256ad9ef0fd5139e","observation_id":"a2962c2f-0e77-42b3-aef7-fcbac00a5771","resolution":{"observed_at":"2026-05-14T02:16:45.880750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"15 Video models are zero-shot learners and reasoners","venue":null,"work_id":"e805cebb-629c-48ff-af2e-5cc1a8222d84","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:2400ea901a89889d9a8bee603e22461a5061012e48659878594290c39e76236b","observation_id":"ab715fa7-ffc0-4b98-b2c7-296648a4e7e3","resolution":{"observed_at":"2026-05-14T02:16:45.884397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T08:15:31.934946Z","title":"Diffusion classifiers understand compositionality, but conditions apply.arXiv preprint arXiv:2505.17955, 2","venue":null,"work_id":"593ccf72-9bdc-45aa-ae77-0d09ffd80c54","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:7bcd026fd5dc31b83c2ff26c54010b9ac7dbdd2dc67ac801eec0cc89f2c8e57b","observation_id":"a2c54ea0-4e4c-4a4d-b816-275a92d5c5d2","resolution":{"observed_at":"2026-05-14T02:16:45.799062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:05.852522Z","title":"Force prompting: Video generation models can learn and gen- eralize physics-based control signals","venue":null,"work_id":"939ac1c8-6355-4da3-88a4-8839a476cf75","year":2025},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:8cb98bb2197377537e0dbcf97a845799a00275e88d23646bd010f0bf4725c34c","observation_id":"cddfd6bc-0e33-40b3-91b4-c2c9ba743516","resolution":{"observed_at":"2026-05-14T02:16:45.804128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02700","last_updated":"2025-03-27T21:38:09Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:59:56Z","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","version":2},"cited_work":{"arxiv_id":"2412.02700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02700","snapshot_observed_at":"2026-07-03T11:38:05.173560Z","title":"arXiv preprint arXiv:2412.02700 (2024)","venue":null,"work_id":"6b9780d6-3db6-4d6b-8b6f-0340ec6e1b41","year":2024},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"cited_paper":"/paper/2412.02700","citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:35c83d646e109277f498c5076f963efbc57112f9137294d9df9d62cfe88ce35a","observation_id":"f114cad5-3a23-437f-b7fc-9982b8b31f6e","resolution":{"observed_at":"2026-05-14T02:16:45.808266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"target image","venue":null,"work_id":"38ed2ce0-4d5a-45f6-93b5-ba3b12caed66","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:234ae912f0fe962cb8425ead03a69144c1630e604ef9737538a81fe55e3f5602","observation_id":"7856f664-b4a5-4927-b09e-3cfdc3488dd3","resolution":{"observed_at":"2026-05-14T02:16:45.888735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Focus on the object {color}","venue":null,"work_id":"79eda215-0daf-4e2b-9ff3-bf66201f8e0e","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:c6f383e8411c4dc440b0a9bb0d3553ed2039e2e46d712f9b37f4d8fafbbc995e","observation_id":"7ba182f8-0dc4-48e4-af9f-9607b4e24084","resolution":{"observed_at":"2026-05-14T02:16:45.892324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For example, if the target image shows a dog, and the choices show a cat, the object types are considered different","venue":null,"work_id":"4de4abc2-3777-4dae-8b73-d07e32d6f894","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:3a6977fdbdd8a1b2a2ba4e3441c6830a81817b44dfb7272364aac38650e22936","observation_id":"b8e22924-356d-4135-82a2-70431328e59a","resolution":{"observed_at":"2026-05-14T02:16:45.896481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Final Answer: [answer]","venue":null,"work_id":"57b6a2c3-e422-4534-9705-0c746bc54946","year":null},"citing_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-14T02:16:45.554252Z"},"links":{"citing_paper":"/paper/2509.20328"},"observation_digest":"sha256:347728e9ee87ab32760ff1d80a6b1ec6e4bbee005e6b2eb9c30089af14408be9","observation_id":"70fc672a-27aa-4c97-86d8-861cd9af2f00","resolution":{"observed_at":"2026-05-14T02:16:45.911481Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":1,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":34,"verified_fuzzy":55},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 100 inbound Pith citation observations for arXiv:2509.20328."}