{"as_of":"2026-08-11T17:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d490dddd41a54c60a3b640d98516778f288a0daa71d35df168b9f32274044058","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T01:04:35.416676Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18966/citation-record","integrity":"/paper/2412.18966/integrity","json":"/paper/2412.18966/citation-record.json","paper":"/paper/2412.18966"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.891030Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.891030Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0b8e42dd00712cc05b182f472cfe3de66c84c7f7d843a07912e89de677d196a0","observation_id":"4f93188e-2dfe-400a-946b-8444a5f851d3","resolution":{"observed_at":"2026-08-11T01:04:34.891030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.412254Z","title":"Lumiere: A space-time dif- fusion model for video generation","venue":null,"work_id":"68201319-31c6-4f01-ab05-5e3910ab06ee","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.899673Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:bcbc0214f4e2b9be102d41f86520dd6312b148f73fa5d397805cef35c5d56018","observation_id":"2d506507-06d0-4fd2-8408-ee526a2c4173","resolution":{"observed_at":"2026-08-11T01:04:37.424442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.374380Z","title":"Improving image generation with better captions","venue":null,"work_id":"ad10c3a8-1159-4bb3-9102-aa9047109416","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.909158Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:f6a513f95dd892082d29da6ebeeb2ca10451c596c5a22fab42d529de50f3fd17","observation_id":"65264e48-4f78-415f-93cf-24f23abd78c0","resolution":{"observed_at":"2026-08-11T01:04:37.391062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.916707Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.916707Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9982ae960ed2f85e26706c15504be089bdef1a10d33bb86139c33c38c1085aec","observation_id":"7acdce46-e9ff-4954-84f5-bb8420c2d8ac","resolution":{"observed_at":"2026-08-11T01:04:34.916707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.924557Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.924557Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d94cd9756685daaa0798e23a9c91f9162c051bf63afa20fdebdda7c0364124a3","observation_id":"1071c5b4-43d3-4666-ab46-58dc859088b2","resolution":{"observed_at":"2026-08-11T01:04:34.924557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.934310Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.934310Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:275240f3aee1c555bc3ee236ea9165710d73ee6effdedfcabd26bf6ccd9618e5","observation_id":"7f99b4b2-d725-4e7b-bdcc-969ce323ba1b","resolution":{"observed_at":"2026-08-11T01:04:34.934310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T01:04:34.943735Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.943735Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:af0a9a616c3cde0c71b788a355cf9b315f3894f5eec49527ba4dbfd62c367329","observation_id":"86ddf32c-274e-4583-bff1-365c83fb2e51","resolution":{"observed_at":"2026-08-11T01:04:34.943735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:34.954429Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.954429Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:e35ee6b80f7ded01e198ee0a2cd5ee58551e02877381477e83819f5f43686b15","observation_id":"9afefb62-49e9-4ccb-be21-a32ee5563526","resolution":{"observed_at":"2026-08-11T01:04:34.954429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.218909Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image syn- thesis","venue":null,"work_id":"3df283ca-9091-4b0b-a6d0-603ab7c63390","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.961354Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:4c2b010a670f4db43ce4d341910a854fce49e61e33d62e5dbb852702973068b9","observation_id":"cf650a6b-a6d3-4881-a51a-48b5312e9fff","resolution":{"observed_at":"2026-08-11T01:04:37.226592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.189901Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"b4c96e18-223b-4217-b58a-2ad8dfdc4e40","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.968168Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9afa58ca24acfd0f49657928aa1a4bb6f7c9949b3fecec371113a6f3d3aeabe7","observation_id":"5e5f47e3-c7d1-43b0-a32b-271cabe9a253","resolution":{"observed_at":"2026-08-11T01:04:37.198557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.127403Z","title":"Contin- ual pre-training mitigates forgetting in language and vision","venue":null,"work_id":"6a069873-4551-41e8-81f9-fbad00f5ed79","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.977168Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b99eb9f7da8d4487b5b5088440fdf1d909b0a6b3bbeec33c26cdacb7e4e2557d","observation_id":"1857c1e7-f202-4dc7-b3bc-572ceb3da728","resolution":{"observed_at":"2026-08-11T01:04:37.141649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.082639Z","title":"A continual learning survey: Defying for- getting in classification tasks","venue":null,"work_id":"71442884-86a6-45e1-b0fb-cb2d10b969ef","year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.986248Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:84223c58130554ba154569594e191199919d904281b3a4e580f0a18ac34ae334","observation_id":"d5edb5ab-538e-4b8e-ae38-07867dbf59e8","resolution":{"observed_at":"2026-08-11T01:04:37.090386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.041450Z","title":"Irc- gan: Introspective recurrent convolutional gan for text-to- video generation","venue":null,"work_id":"0fc332bd-a81c-4046-a549-4b3b2527bfae","year":2019},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:34.999548Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:7f94ac3b7d75466d078979c02a724294b3634b17c636446b9180d711df8275ef","observation_id":"6115f435-d074-4e1d-a2e9-6d24a305a36d","resolution":{"observed_at":"2026-08-11T01:04:37.054938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:37.005077Z","title":"Catastrophic forgetting in connectionist networks","venue":null,"work_id":"eece2c18-1af3-43c7-9e94-7d77eb356f6e","year":1999},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.009018Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:049c89032e4f8d76087d4a67895a7215cbf1d5f1ef87b16a07f12f66edf316c7","observation_id":"8b915457-2b3e-463a-8ebf-507109f939a3","resolution":{"observed_at":"2026-08-11T01:04:37.020898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.971428Z","title":"Videostu- dio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"b28e8fbe-ac7c-4411-81dc-7db86467ff31","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.020241Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:3d4ecd762c1399b2b992ce2d6a9172908cb6dfe4da4df253b109ca14e88a3240","observation_id":"eb0f6510-8aa8-4672-9a72-3c07a375f1bb","resolution":{"observed_at":"2026-08-11T01:04:36.979001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T01:04:35.030224Z","title":"Lumina-t2x: Trans- forming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.030224Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:46324a5f1bf3a13fa692c79f239fb753ca39ccf4a395c81c739976bbb88fa32e","observation_id":"c5a220a6-cc78-4066-bc0d-e24c36358e57","resolution":{"observed_at":"2026-08-11T01:04:35.030224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.943409Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"ebd653b9-d92d-4313-b0a3-9c21c5244ebc","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.038115Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:72664d95091d988a4e5465741f9ce8a2a1377d0085eb7893b5158eb96127d84e","observation_id":"9b0f21a0-c469-4180-8caf-89b54035d244","resolution":{"observed_at":"2026-08-11T01:04:36.951409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T01:04:35.050124Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.050124Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:1bd016be1e08c29605143bae4007a0d934959d249b2b6e68025018978dc5021e","observation_id":"dbf4ee18-95f0-4d83-9c83-80c374b26fb5","resolution":{"observed_at":"2026-08-11T01:04:35.050124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.056511Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.056511Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:deb33aff0846ce87dabbf4e6c65fdecc40a2ff92ec71f025b09542fb1b108694","observation_id":"6ae13927-af9e-4072-9a43-94d2677e0788","resolution":{"observed_at":"2026-08-11T01:04:35.056511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.877824Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"fa318155-22e6-49e0-9c24-97e2ba08dd37","year":2025},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.068618Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:88b93b47082effec77f98a4ea0d6f219e324f6e325e457dbd0a8eab464e4d6fe","observation_id":"e2eb497d-0d51-4551-bac0-1f4449f9b56d","resolution":{"observed_at":"2026-08-11T01:04:36.901018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T01:04:35.077390Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.077390Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:53131b0e568bb8ed1dcf44be65e465769171cf448c155d047d9410acc6f6082d","observation_id":"54c4ca97-239e-448c-8ed0-cd1d32be011a","resolution":{"observed_at":"2026-08-11T01:04:35.077390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-08-10T11:29:52.328080Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-11T01:04:35.082441Z","title":"Animate-a-story: Storytelling with retrieval-augmented video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.082441Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:f59bd10f108d5dcce416c8cc53f3d5dbf271551ce8aaffa0febe70d949a42f60","observation_id":"65b639a6-8f91-43ad-8743-471ad106b4f3","resolution":{"observed_at":"2026-08-11T01:04:35.082441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19334","last_updated":"2024-06-09T11:34:12Z","snapshot_observed_at":"2026-08-10T12:28:17.826279Z","submitted_at":"2024-05-29T17:59:20Z","title":"LLMs Meet Multimodal Generation and Editing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19334","snapshot_observed_at":"2026-08-11T01:04:35.095299Z","title":"Llms meet multimodal genera- tion and editing: A survey.arXiv preprint arXiv:2405.19334,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.095299Z"},"links":{"cited_paper":"/paper/2405.19334","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:71a742785189522b071f761c979743a720aa76672581d72718a64d45f7067c6a","observation_id":"4c28b58e-12cf-4e74-b374-64c44e730325","resolution":{"observed_at":"2026-08-11T01:04:35.095299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T01:04:35.105992Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.105992Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b6b88a37575d26dd00dc330c2ffa0dbf562bc46539fee068eefdf9e16aa002cf","observation_id":"0ef79add-b938-4221-b8c6-13b346135884","resolution":{"observed_at":"2026-08-11T01:04:35.105992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.115211Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.115211Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d3e21400fda3556990ca9f9e49893fcb09e1b71859b1c30ecf0931dc83f3198f","observation_id":"6502a7d2-95b9-479f-87be-87b053ff6552","resolution":{"observed_at":"2026-08-11T01:04:35.115211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14330","last_updated":"2024-02-06T18:44:30Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:57:09Z","title":"DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14330","snapshot_observed_at":"2026-08-11T01:04:35.123565Z","title":"Direct2v: Large language mod- els are frame-level directors for zero-shot text-to-video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.123565Z"},"links":{"cited_paper":"/paper/2305.14330","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:7946c59b410146cffef837aea283a16d52fa2fa75d23459245e4b365c2e158cb","observation_id":"6b1d7871-dc3a-42d5-9900-de618ddb4c2c","resolution":{"observed_at":"2026-08-11T01:04:35.123565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.129333Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.129333Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:03555a0e55a942645b74a954a824b02ca871391f2f5bb3f0329d1bcd4ddc09b0","observation_id":"6df7b4bc-64e9-4b8c-ad73-677bb985d473","resolution":{"observed_at":"2026-08-11T01:04:35.129333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.797451Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":"bd7b1056-cbca-4825-8340-6df552d46939","year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.136837Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:e7015ddab0ea95884757aa74afbaa605b01f22f86fdf2ca92a590d55e6b44ae6","observation_id":"cfa864c4-37bc-4e12-8618-5eb4d23d8d6f","resolution":{"observed_at":"2026-08-11T01:04:36.814147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.754592Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"76c1085d-3b97-4915-b7ce-12b07d9376d9","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.142817Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:eea48848fd7ddcdd0a9d57df8fa1b80ee10ba158a1c5d34f60e7eb2ab652d935","observation_id":"e25e9399-74f3-4834-82c9-e216993040ef","resolution":{"observed_at":"2026-08-11T01:04:36.774461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-11T01:04:35.150244Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.150244Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:41da00b2fd2a1db7c8a76e414863882a4c97cf15f1f60c65f6904d162a59104e","observation_id":"a122b23e-ac11-46a5-a1ea-d759b41a5827","resolution":{"observed_at":"2026-08-11T01:04:35.150244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.731152Z","title":"Continual pre-training of language models","venue":null,"work_id":"a8906959-5854-49b6-9c5c-5347b78e7853","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.170485Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:1ea3e9879dad7e9ddcb8f832c3ae95dabbe1248bc413983b1aeb710aca5f4975","observation_id":"e0065cca-0473-4b6e-826a-66aa850c447e","resolution":{"observed_at":"2026-08-11T01:04:36.738658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.184878Z","title":"Open-sora-plan, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.184878Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:9461bd3d9676ea92ec7a7d623c7e39a49bf0e47a45d99cf63f333c169d7310de","observation_id":"17de3f09-e731-4c82-8bc1-b9407b894cb5","resolution":{"observed_at":"2026-08-11T01:04:35.184878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.197675Z","title":"Llava-next: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.197675Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:b8f636a7339f112605f9e9597ef6eee1de34c31bc361bcff795c17e8e77d632e","observation_id":"83037e88-3364-4874-9c81-06457a5e886b","resolution":{"observed_at":"2026-08-11T01:04:35.197675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.206474Z","title":"Video generation from text","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.206474Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:38488393a2e2f4adfb859779e27cc5f973425d556485ab5dca10b7b874cecb3b","observation_id":"99fc34b5-5ff3-4507-b61a-ceae3cb6d0ce","resolution":{"observed_at":"2026-08-11T01:04:35.206474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.618215Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":"a1b42684-b002-41a2-bbb1-9c87935f8a51","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.223224Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:25934f899505d335ee1228ab746e3df0e59488410b5d401034f548589951b658","observation_id":"b1a42560-6736-442a-9285-dbd368053cf5","resolution":{"observed_at":"2026-08-11T01:04:36.630561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T01:04:35.230155Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.230155Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:84c6ab1be87decbc1c299f67d37cb7682215ad0669c35a915f1c2b58ee8d597e","observation_id":"f69a88bc-708c-4782-a945-7b7a06fc6934","resolution":{"observed_at":"2026-08-11T01:04:35.230155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.240530Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.240530Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:5030a380664f8dbc2da6bebcb187c6aedc7c842cee381c7dc49b537f8e6eb1c0","observation_id":"e6ca6569-8f76-452c-8ac1-19b4e607729b","resolution":{"observed_at":"2026-08-11T01:04:35.240530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.563232Z","title":"Sync-draw: Automatic video generation using deep recurrent attentive architectures","venue":null,"work_id":"92d75f66-470f-458b-9859-a0b9a4734758","year":2017},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.256364Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:5792ff7bffb438e2e5b7d39def30717b57bafaea3a944783ac91ee4a3e550e44","observation_id":"b69fd12d-e3c1-4381-8baf-34053845f54d","resolution":{"observed_at":"2026-08-11T01:04:36.572032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.263136Z","title":"Jour- neydb: A benchmark for generative image understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.263136Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:53ddfa2d2dc0d6065d552e4dac2a6dda46e30c6a902e659715ec6bfe0ee03ac6","observation_id":"5128715b-3fb4-45e2-a9ef-496d73edf303","resolution":{"observed_at":"2026-08-11T01:04:35.263136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.270449Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.270449Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:c52309936666b91819d1a45080a8904c54a464ff00173b2011a52b06364bd180","observation_id":"f19c022c-0c68-418c-b541-b8aee8e2c3c4","resolution":{"observed_at":"2026-08-11T01:04:35.270449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.278274Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.278274Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:10b56541dae833bbd7f29fce1275122fa59f4d47d35e9e34de28f81ab8d19be5","observation_id":"8a78e60a-17bf-43ac-8009-6d75cfc50cf4","resolution":{"observed_at":"2026-08-11T01:04:35.278274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.467437Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"558d47b2-cd77-4e16-a5f5-43c0857847c6","year":2020},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.282958Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:5bef7d67da3daf8aca7f8f0f9cfb1c1d57617d33c6f898ac426f9c5bf4215601","observation_id":"b467d429-bced-4f93-830d-1607b803caee","resolution":{"observed_at":"2026-08-11T01:04:36.483662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-11T01:49:02.037469Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-11T01:04:35.287887Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.287887Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0dd8844ea0568e7d553571574eda5a93f3720a8dad9640f9b0c5625d15fc4969","observation_id":"3da6630f-6637-41ae-a223-0035c167fc5e","resolution":{"observed_at":"2026-08-11T01:04:35.287887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-11T01:04:35.295977Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.295977Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:22ed437b37cb321f0c3cba7cbed67b15bb2fd955a4a251b2a97734c0ca026e8a","observation_id":"19552679-5593-49c2-9c43-f928984dc853","resolution":{"observed_at":"2026-08-11T01:04:35.295977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.427735Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"92dab650-9d66-435e-abb2-e03582b14555","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.304811Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:2e8656606ba4423faabecba018963efb05b5ecb48de968278625cc26eebdf0da","observation_id":"e4111d41-5972-45a6-9894-bab94533913a","resolution":{"observed_at":"2026-08-11T01:04:36.435782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:35.316897Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.316897Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:d61defd65726ff78303aa73856d3c84d9d8e2fa34aceb7af8fd4e0d6e772a9c9","observation_id":"c01c39a3-e640-4fb8-9888-02961b128f2f","resolution":{"observed_at":"2026-08-11T01:04:35.316897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.371846Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation, 2024","venue":null,"work_id":"97954e2a-0e78-45c3-85ed-dfde6d85a245","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.323886Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:c73ff06f82b9dede11f11e6564d4e2ba9d504add545c27044c36473512a4b1a7","observation_id":"c7c2b8c9-8e60-4fe8-81f9-03bfbb476481","resolution":{"observed_at":"2026-08-11T01:04:36.384581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06762","last_updated":"2023-10-10T16:38:49Z","snapshot_observed_at":"2026-08-11T01:23:29.043493Z","submitted_at":"2023-10-10T16:38:49Z","title":"TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06762","snapshot_observed_at":"2026-08-11T01:04:35.334537Z","title":"Trace: A comprehensive benchmark for continual learning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.334537Z"},"links":{"cited_paper":"/paper/2310.06762","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:be9d2c58c5869eaf4ef45d6efec84b2d077aa6fdd5641f22999300b172dcc32c","observation_id":"31901252-b885-434a-9e13-e2a4b7f0fde7","resolution":{"observed_at":"2026-08-11T01:04:35.334537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T01:04:35.342459Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.342459Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:58dae00e2b5231aec59686d1141179ecffd7d1366632ecb3dbeff1164dad75a9","observation_id":"1c90472d-1505-4b1b-8dbc-f0ea85c79723","resolution":{"observed_at":"2026-08-11T01:04:35.342459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T01:04:35.349663Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.349663Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:aa7c2c4f33b22104915cb5df04f2f5a04ce0e5a8509d8f0383ca8185f247762b","observation_id":"ef30cbfb-6a67-4517-b548-ff8ac4c01afd","resolution":{"observed_at":"2026-08-11T01:04:35.349663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.319622Z","title":"LLaMA pro: Progressive LLaMA with block expansion","venue":null,"work_id":"a4df178f-2905-4a95-9308-5b2174345312","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.358531Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:7d3197c245ea4cdf00e17c41f2d2a121a877f76044deb1b0caab685c529a40ca","observation_id":"1d6f23ce-6dc9-4cd2-a31e-5259de3f0449","resolution":{"observed_at":"2026-08-11T01:04:36.330890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.271813Z","title":"Vript: A video is worth thousands of words, 2024","venue":null,"work_id":"11c3f107-3e3b-4cac-aa7b-5616a34562e4","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.367105Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:77874851e826063a95f81d4dfc193814991631d94a6cb0fc1a621f8f76621c4c","observation_id":"cf330d11-9aa7-4b63-85bd-0c51fcab8702","resolution":{"observed_at":"2026-08-11T01:04:36.288520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T01:04:35.377149Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.377149Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:0b52b8afb67ca5c435180bab6e62ca52db8d920353f6cab42648cef013806482","observation_id":"c755604e-2b24-4701-8e21-fe7597d3bb59","resolution":{"observed_at":"2026-08-11T01:04:35.377149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.240544Z","title":"Language model beats diffusion-tokenizer is key to visual generation","venue":null,"work_id":"b63ac600-08bf-48fe-9dfc-278b06e38571","year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.385041Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:aded402c65675785243bf37cad189447d4aa167032300f4ea149293f3d0b04f6","observation_id":"5cc165ec-c1aa-4c8b-8db4-733edfaaf277","resolution":{"observed_at":"2026-08-11T01:04:36.250826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-11T01:04:35.396189Z","title":"Show-1: Marrying pixel and latent dif- fusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.396189Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:7886e3352ec25b37a1e185d003e10c6d30b2530f4ea9b4f5792f2c5f4aa45075","observation_id":"8f96385c-1f72-4902-8aac-1f7e543c5e7c","resolution":{"observed_at":"2026-08-11T01:04:35.396189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:04:36.204694Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"a2d09950-11a3-499c-a87d-1f215632316c","year":2024},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.406134Z"},"links":{"citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:c512f054769ed45b55e7db0ed2f3d58bc1b9331377a68a64d68dbd3bfbf7da4a","observation_id":"cb8924cb-da26-4933-a0ca-c805c9a3a61e","resolution":{"observed_at":"2026-08-11T01:04:36.218328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T01:04:35.416676Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:35.416676Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.18966"},"observation_digest":"sha256:bcfcb767dc1156b080e944ee01f36cda1908f645c8e43e87acc0acc6240c32fd","observation_id":"e05f910e-1c09-4a7a-834a-311f74a36604","resolution":{"observed_at":"2026-08-11T01:04:35.416676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18966","last_updated":"2024-12-25T18:58:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:23:40.737092Z","submitted_at":"2024-12-25T18:58:07Z","title":"ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2412.18966."}