{"as_of":"2026-08-05T04:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3049e4a7dca7f20616a1a6f7e346afdecb7edbb72597c3d3f28d244d0f0b003d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:56:33.961865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T07:56:04.692157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:ef4f35fe3dd27039cd29c4d591c8a3219b222c59dadc4fb3fcf8a3b0440caee3","observation_id":"d3ea8e14-b555-4cb7-8a88-adabe49cab4e","resolution":{"observed_at":"2026-05-18T14:40:00.032419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:39321604015003c7d6df152e4e040756fd145a32db8a331197f8edd0d9bdf7f5","observation_id":"390de76e-87ca-478f-acca-2019bac7a998","resolution":{"observed_at":"2026-05-21T18:00:27.203120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2601.04068","last_updated":"2026-05-20T06:08:56Z","snapshot_observed_at":"2026-07-06T22:41:01.254450Z","submitted_at":"2026-01-07T16:32:17Z","title":"Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T16:25:03.743594Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2601.04068"},"observation_digest":"sha256:129204e68dc76819a3de1761f59a9f4791045b2c3bf185eeda88f633ddb749b0","observation_id":"e9a2f9df-bd54-4244-9eed-4e6bf4ae1808","resolution":{"observed_at":"2026-05-16T16:28:05.580957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2601.04068","last_updated":"2026-05-20T06:08:56Z","snapshot_observed_at":"2026-07-06T22:41:01.254450Z","submitted_at":"2026-01-07T16:32:17Z","title":"Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T16:01:52.150950Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2601.04068"},"observation_digest":"sha256:1217321dddf7ebe6db231c4a72f7056cd066cdb44957c682868cde9d9a7e05cf","observation_id":"c9616a39-1e50-41c6-94d1-c11ac9fe2134","resolution":{"observed_at":"2026-05-21T16:04:14.709987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2603.05539","last_updated":"2026-05-08T14:58:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-04T10:39:04Z","title":"VDCook:DIY video data cook your MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T16:52:36.882218Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2603.05539"},"observation_digest":"sha256:6d060ea840e8668776cfa2de40c63e7f929e065672409620bc15d1f4e234164a","observation_id":"c77cf558-2b39-49cc-b1f4-fae8875e98cb","resolution":{"observed_at":"2026-05-15T16:56:19.221954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-02T16:56:33.961865Z","title":"arXiv preprint arXiv:2408.02629 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01700","last_updated":"2026-07-20T03:39:00Z","snapshot_observed_at":"2026-08-04T07:22:17.279993Z","submitted_at":"2026-04-02T06:58:46Z","title":"Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T16:56:33.961865Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2604.01700"},"observation_digest":"sha256:8707876454710561b4191ea77d205d303e649d099188e2a6b6159b5ca0ddee59","observation_id":"08fdc825-9988-48cb-86a3-653e8224fdc7","resolution":{"observed_at":"2026-08-02T16:56:33.961865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2604.07230","last_updated":"2026-04-09T11:01:59Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T15:53:57Z","title":"PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T18:54:47.451103Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2604.07230"},"observation_digest":"sha256:57b741f7336d02f30df096a9a4b9c9a8fc8cb35d42dda9fcb3bf323f76de0ea3","observation_id":"c20ae787-89ea-405c-92c4-52f261aa6189","resolution":{"observed_at":"2026-05-10T23:45:50.458209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2604.24762","last_updated":"2026-04-27T17:59:19Z","snapshot_observed_at":"2026-08-04T10:58:19.065767Z","submitted_at":"2026-04-27T17:59:19Z","title":"OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:15:20.045060Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2604.24762"},"observation_digest":"sha256:17274d0999d8f613bdc5c8601a3ae50bf401978377a71a4c67d4013bbf0680c6","observation_id":"e1562e97-2246-4edc-921f-17f561d6d65e","resolution":{"observed_at":"2026-05-11T21:46:49.069232Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2605.21489","last_updated":"2026-05-21T21:50:17Z","snapshot_observed_at":"2026-08-02T14:20:11.088817Z","submitted_at":"2026-05-20T17:59:52Z","title":"Variance Reduction for Expectations with Diffusion Teachers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T04:51:57.800006Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2605.21489"},"observation_digest":"sha256:d9201a9428c625523845839afeb56f87fa80172e3fe7273af7eb666d5cf21704","observation_id":"cdfcdd4e-e450-4e2a-a17b-86b549ad0622","resolution":{"observed_at":"2026-05-21T04:53:57.919961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2605.21489","last_updated":"2026-05-21T21:50:17Z","snapshot_observed_at":"2026-08-02T14:20:11.088817Z","submitted_at":"2026-05-20T17:59:52Z","title":"Variance Reduction for Expectations with Diffusion Teachers","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-25T05:41:10.076206Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2605.21489"},"observation_digest":"sha256:2e564f065c5d2750be454d22ffad700f034e7efb48f1ca8afe6682bdb1ae822d","observation_id":"3e10c653-0cca-4927-a583-1d6cceba155a","resolution":{"observed_at":"2026-05-25T05:45:24.685953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:69ca53abd0c4a3518f570e6ba723c0dfafc38ba0b17afe195d37a98ec3991ba5","observation_id":"1fa789f5-e1b1-4950-8b96-b313095709a1","resolution":{"observed_at":"2026-06-29T23:04:01.932824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:62b3ba42f73fc29cfbb68481949f2b4b9684b0bb92709f0690d805cbfe819030","observation_id":"f9d4710d-4d57-43be-8766-893118d790e6","resolution":{"observed_at":"2026-07-02T02:16:26.776236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:b034d27d705e7adc8107fb174885ae39dc73c7e3eeec4bd76e519a2a861826ef","observation_id":"0f8ec3eb-70b6-4884-b4e6-72129c28253c","resolution":{"observed_at":"2026-07-02T07:16:44.728428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:8c42f4535942cb04259a8dc469141a26e50214023b7d98f7d11f854bd0e39ece","observation_id":"a6023803-aa52-45f6-997c-ca561d221cb9","resolution":{"observed_at":"2026-07-03T00:07:28.154541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.16533","last_updated":"2026-07-03T04:30:36Z","snapshot_observed_at":"2026-07-12T13:47:19.539499Z","submitted_at":"2026-06-15T10:37:42Z","title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T04:02:53.110012Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.16533"},"observation_digest":"sha256:633a57c101dd74172af02d36eca09fc308e55b3860ad69962ea30b4ef7aa8343","observation_id":"dcd6ee96-b556-420b-b064-51f048eb7cce","resolution":{"observed_at":"2026-07-03T17:28:44.842107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2607.07534","last_updated":"2026-07-08T15:33:25Z","snapshot_observed_at":"2026-07-11T23:20:11.647150Z","submitted_at":"2026-07-08T15:33:25Z","title":"Infinite Worlds with Versatile Interactions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T07:51:36.802801Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2607.07534"},"observation_digest":"sha256:e97e83ec4676560307827d16d21490a4d76516e40ccbaa29badcb4e0028ec46f","observation_id":"5f133fd3-a200-47b8-b965-12e576e6ac11","resolution":{"observed_at":"2026-07-09T07:56:04.693407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-01T14:30:46.262409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19437","last_updated":"2026-07-21T06:36:32Z","snapshot_observed_at":"2026-08-04T22:29:11.451882Z","submitted_at":"2026-07-21T06:36:32Z","title":"Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T14:30:46.262409Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2607.19437"},"observation_digest":"sha256:ec6e7e8680d4e951b80b1f654d03961044800a85ac9b92972099b622d058468c","observation_id":"500fa9be-3d54-4470-8bef-a7b993569353","resolution":{"observed_at":"2026-08-01T14:30:46.262409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.02629/citation-record","integrity":"/paper/2408.02629/integrity","json":"/paper/2408.02629/citation-record.json","paper":"/paper/2408.02629"},"outbound":[],"paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2408.02629."}