{"as_of":"2026-08-13T08:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51a13436f22733f5548676d820c9498fd1ab47b355a37014e8477392731ecdf0","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:51:11.861299Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:09:07.991313Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T01:53:28.925576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03085","snapshot_observed_at":"2026-08-05T21:09:07.991313Z","title":"Mimir: Improving video diffusion models for precise text understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09454","last_updated":"2025-08-13T03:11:28Z","snapshot_observed_at":"2026-08-12T10:53:52.650501Z","submitted_at":"2025-08-13T03:11:28Z","title":"Animate-X++: Universal Character Image Animation with Dynamic Backgrounds","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T21:09:07.991313Z"},"links":{"cited_paper":"/paper/2412.03085","citing_paper":"/paper/2508.09454"},"observation_digest":"sha256:e68dd911a167759afc04c9059dd0b68be73e43f73717c1843aebbc7ee21c8dbd","observation_id":"71f99619-f953-4740-9ac9-36f852f104e7","resolution":{"observed_at":"2026-08-05T21:09:07.991313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03085","snapshot_observed_at":"2026-08-05T19:07:34.083942Z","title":"Mimir: Improving video diffusion models for precise text understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-11T04:07:10.416721Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:34.083942Z"},"links":{"cited_paper":"/paper/2412.03085","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:2a685fee509b30aff392a3d40312da67af71e079e1895c7c57b963641b56f872","observation_id":"ed581e4b-c3b5-4117-9062-2b5d37bed3de","resolution":{"observed_at":"2026-08-05T19:07:34.083942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"cited_work":{"arxiv_id":"2412.03085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimir: Improving video diffusion models for precise text understanding","venue":null,"work_id":"e94317a4-b6c8-4464-91b2-d7049db52993","year":2024},"citing_paper":{"arxiv_id":"2605.14569","last_updated":"2026-05-14T08:39:42Z","snapshot_observed_at":"2026-08-05T11:27:50.353545Z","submitted_at":"2026-05-14T08:39:42Z","title":"Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T01:51:57.018809Z"},"links":{"cited_paper":"/paper/2412.03085","citing_paper":"/paper/2605.14569"},"observation_digest":"sha256:a29171ac1702fd9666508aa1437e3bcdd6a6e048b6e6656d85c4b7c9658758df","observation_id":"8513a963-5d84-4bb1-b70d-40f6565b1a0b","resolution":{"observed_at":"2026-05-15T01:53:28.927343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03085/citation-record","integrity":"/paper/2412.03085/integrity","json":"/paper/2412.03085/citation-record.json","paper":"/paper/2412.03085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T22:51:11.612873Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.612873Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:52ec2daaba9b53e258edf6ae703b6540c6fa6ac828833ce2148fa301fd591a04","observation_id":"fa3d78dd-059b-486f-854a-f07c0d1cf60d","resolution":{"observed_at":"2026-08-11T22:51:11.612873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T22:51:11.617764Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.617764Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:668a4f7b2ac6c40e39d2bfa75d1bb9fbf19f8b0f51faf85a1d5e94e0b864e02a","observation_id":"174ce6c1-871c-49fe-be62-2eee06cdd298","resolution":{"observed_at":"2026-08-11T22:51:11.617764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-11T22:51:11.621761Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.621761Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:bcd1b857e43348c7c6752673946e2600770b0ecb0741fff0f0170679aebe4472","observation_id":"93c2fe9c-38a0-42f0-b0c2-532a69bedd52","resolution":{"observed_at":"2026-08-11T22:51:11.621761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-13T00:34:33.528585Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-11T22:51:11.626353Z","title":"Llm2vec: Large language models are secretly powerful text encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.626353Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:c3ef01dd4535f0c254c8dc053e05adc341c622effb706e3f7b868b24e59fc988","observation_id":"31fbc9c4-a06d-4694-896e-45314cf6334a","resolution":{"observed_at":"2026-08-11T22:51:11.626353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.630859Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.630859Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:8896424a27ab9b5b5b1ab4e0a5a8e34181606409dddb51e36e4fed5d8d26de26","observation_id":"a5492bb5-849a-4f41-a4fb-73ab32b8f523","resolution":{"observed_at":"2026-08-11T22:51:11.630859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:51:11.634791Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.634791Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:a14105626b616fe65f58314e1aa00c4552c4cc952ee6f2ede8f2c0165d9c16d6","observation_id":"dc2703c4-4df9-446b-ae3f-c6d6f1b7fdb4","resolution":{"observed_at":"2026-08-11T22:51:11.634791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T22:51:11.639492Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.639492Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:2ae428c9dc87613280faf5a2a97dbbd72dfd460863ec69238a826946a0c444ff","observation_id":"f009921e-e3c9-4f5c-aa70-1002c1168767","resolution":{"observed_at":"2026-08-11T22:51:11.639492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-13T00:59:54.489440Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-11T22:51:11.643736Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.643736Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b9907bb0a2ba4a701ce579771cf393831ec277dc08d2967f8a4b4aca2edbc26c","observation_id":"5b167563-b1c0-4aff-a3e9-c7d1ffa9c571","resolution":{"observed_at":"2026-08-11T22:51:11.643736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-13T04:45:10.488145Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-11T22:51:11.648408Z","title":"Pixart-{\\delta}: Fast and controllable image generation with latent consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.648408Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:04f8c785f3e9189368f36750141bc0e7af08d354a168348e192ccda31b6d2de8","observation_id":"de3a697d-3f46-4bb7-ad16-68da13c74268","resolution":{"observed_at":"2026-08-11T22:51:11.648408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-12T22:53:05.902024Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-11T22:51:11.651909Z","title":"Od-vae: An omni-dimensional video compressor for im- proving latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.651909Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:52d6b2517141e97b9bb0976c4e89a8f1edd3768214a6f051d2c821c8ff046027","observation_id":"66913913-901d-4840-89c9-15821d23ebca","resolution":{"observed_at":"2026-08-11T22:51:11.651909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.656089Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.656089Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:e718656b410e150bca0b41af032f7fe4220df9d66a4f92c9e030162088f71b68","observation_id":"b244d4ae-c421-41b0-a980-c1150df05139","resolution":{"observed_at":"2026-08-11T22:51:11.656089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.500809Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"9b4de763-d612-4284-a92c-1b3c2982516c","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.659739Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:036a289fd966888637a91b9329ddee6ca4236dee7766988077b912aa368a4be5","observation_id":"62d3c6c2-d215-4a35-b549-8674f9f8b614","resolution":{"observed_at":"2026-08-11T22:51:12.504267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.663489Z","title":"Perceptual quality assessment of smartphone photography","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.663489Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:07b5aa7f9e253f7a887ee186a47dfe0aab6d82cf1d863d2d6316c5f524b4da80","observation_id":"a619a1c5-5332-4ef9-ba53-7b5841425048","resolution":{"observed_at":"2026-08-11T22:51:11.663489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.485070Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following","venue":null,"work_id":"e8faae64-50c7-41a2-9efd-cc96d2530c00","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.667579Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b0eb3bc9197219ef505498fffc3de7a61a30f5af0e5131e4c1f0545ddfa8d7ea","observation_id":"e2a60417-8b0d-4c08-9027-32ec10e61a03","resolution":{"observed_at":"2026-08-11T22:51:12.488580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T22:51:11.670823Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion trans- formers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.670823Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:0fd5fb21268be6ac3547e20a6490e0d73aa921613c4eff50ed5bda36ec025806","observation_id":"45b05fbf-8760-4267-bc57-45d5b7dfed17","resolution":{"observed_at":"2026-08-11T22:51:11.670823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.473784Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":"c4e77a86-8c84-4f44-bf18-c489b169ba19","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.674621Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b507aadabc700040922395ed8a17899141b80b16df440aea4a25d18d9d526398","observation_id":"c3cf3bea-0787-4c18-a181-d61f21012c25","resolution":{"observed_at":"2026-08-11T22:51:12.477864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.462694Z","title":"Check locate rectify: A training- free layout calibration system for text-to-image generation","venue":null,"work_id":"6a14da60-a7ae-4921-904a-12941a2f99d1","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.678765Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:76b532266d3de805b8fa18e6c2d4feb4fe90a5c8ef6bae59c7a9edb72509962c","observation_id":"8db5b61a-cb49-4097-bf14-00676a7ecaf5","resolution":{"observed_at":"2026-08-11T22:51:12.466479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-11T22:51:11.682448Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.682448Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:298d7a5e70fac445e0848ee4c0d2bb4d663f9fced468f3da0492cc6c7e3af592","observation_id":"7a1b328f-6ac9-4d11-a578-f0ca4f9f0ed1","resolution":{"observed_at":"2026-08-11T22:51:11.682448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.686779Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.686779Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:f1f9e4eba682fe585adc3e327b70b9212233f6c1ba994aeb6a0268606619e6e6","observation_id":"7d66e66d-b89d-4fc4-8936-e018f8b2aada","resolution":{"observed_at":"2026-08-11T22:51:11.686779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.690080Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.690080Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:65d2a47a72029780005c3243f51d707b1521def5bef96d10b154a2b0cf4f92fe","observation_id":"d8128cdc-9f30-49be-9d2c-1ecf7b7ddc93","resolution":{"observed_at":"2026-08-11T22:51:11.690080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T22:51:11.693552Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.693552Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b76917a2e3820b80cc55134ec0b18f3cac0ed3a986f2f408c4dacd88e797726d","observation_id":"72645895-e98b-4a7f-a8a6-0a3b48f4dc0d","resolution":{"observed_at":"2026-08-11T22:51:11.693552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T22:51:11.697842Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.697842Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:cc8fc0ac6ae5409d57def19de455dbfab16a6d1f3e03240b97ea674e2beb34b2","observation_id":"a21b01a0-49ff-4cb7-b178-40b54e03990d","resolution":{"observed_at":"2026-08-11T22:51:11.697842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-11T22:51:11.700744Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.700744Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:bb2af417fe5448d9a7f009055aec203b3fefd5ae7d22aef9156d1bbbe84edf7c","observation_id":"22e6d8b2-de04-450e-83c8-346d24e7b021","resolution":{"observed_at":"2026-08-11T22:51:11.700744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.440079Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- 9 tion","venue":null,"work_id":"79a017f9-93d7-4401-ace7-453f6664d467","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.703692Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:7432691f8cd1a7618dd489613ab3861340c04663ad100c17f4edec8d2eed92f8","observation_id":"6baa9656-9778-4f21-8fb8-8ab3caa37b8b","resolution":{"observed_at":"2026-08-11T22:51:12.444116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.427573Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"14004fa9-77c0-413c-bd1a-eb50eb94946e","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.706469Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:0d282e1e75ecc934375eaf4937f3c26773f6d0ca8a7ded28844f4b4f3d51150f","observation_id":"ebc51882-8616-4c0c-bf7d-49852386588f","resolution":{"observed_at":"2026-08-11T22:51:12.431850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.416249Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"731b1281-a3b7-4efe-9529-3f9806463f22","year":2021},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.709085Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:73df299c167a7a9a04e93b61cc67fcc4315c2c55156ef86fda59aad993dba48a","observation_id":"6239cb00-0320-49f7-9520-3e90afdea811","resolution":{"observed_at":"2026-08-11T22:51:12.420034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T22:51:11.711501Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.711501Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:7885f685ffbf220ef2193f41c5f3c88089730055f90e5fbe26aebc337b990d05","observation_id":"b88ade9b-eb5f-425a-a074-e21a22a4ae57","resolution":{"observed_at":"2026-08-11T22:51:11.711501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.406412Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"ad0b5997-15ee-458a-b8eb-db194ff17e5f","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.714777Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:91eae64d6e9783c59f2bf1dc919df9be9164c5430394e823ee6a4044aaf879d4","observation_id":"397fdc8b-b211-4ac7-a6b7-8bfe676f77f5","resolution":{"observed_at":"2026-08-11T22:51:12.409609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.718305Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.718305Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:01e48cf93d93a1a039ea1ef6df7c31c96edfd2591b40613004d909180e019ab6","observation_id":"2220ec05-9a82-44ac-a17d-68ab422d66f6","resolution":{"observed_at":"2026-08-11T22:51:11.718305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.390631Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"f09ee851-c523-4b73-9f36-4314834bce0a","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.721349Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:450f86331cb0013e99766be9a5412242dffa38477c1be00b8bfbbbd51fc72adf","observation_id":"d22d68cb-0418-4f31-a267-d067f09854cd","resolution":{"observed_at":"2026-08-11T22:51:12.394518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11831","last_updated":"2024-12-05T04:06:09Z","snapshot_observed_at":"2026-08-13T01:30:06.036786Z","submitted_at":"2024-06-17T17:59:43Z","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11831","snapshot_observed_at":"2026-08-11T22:51:11.725237Z","title":"Exploring the role of large language models in prompt encoding for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.725237Z"},"links":{"cited_paper":"/paper/2406.11831","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:38ead558561b44ac5968f98ed44f88f139c340cc5b5abab803f3578ff2cc6b56","observation_id":"f1f1dd64-9159-4d62-bedc-24cca4f2eeb3","resolution":{"observed_at":"2026-08-11T22:51:11.725237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T22:51:11.729407Z","title":"SDXL: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.729407Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:f2202dd78c061c27154e7a857c0e6d103066cd684025c33b06fd26d262e9c2ef","observation_id":"94af8bdb-1df9-49ce-be09-ab6e4bf4e9aa","resolution":{"observed_at":"2026-08-11T22:51:11.729407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.381356Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"97997a82-c7a9-4b29-a32d-b7392c4c4613","year":2021},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.733125Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:63cbe235d4606910378e19771bf263dcd2b6554576c10fcf0b860b05a51e191b","observation_id":"caf6a1f7-5e7c-418c-b5eb-ce2e29ce478f","resolution":{"observed_at":"2026-08-11T22:51:12.384419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.736887Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.736887Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:7cadb300205e741eb7d35536560b07cd01e873485a163e8fb2a6e3761ab81f7b","observation_id":"9cdd973b-fe4b-4b4c-ba09-61c8c29dd0c8","resolution":{"observed_at":"2026-08-11T22:51:11.736887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T22:51:11.740143Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.740143Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:2443466890675ce7e8167b9c2c71dd9621d20dba1f0616354afa4550c5d205ac","observation_id":"ca035896-122e-4992-b697-583963c91b40","resolution":{"observed_at":"2026-08-11T22:51:11.740143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.364127Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"cf1ba5cd-3605-41b3-84de-33c89aa6467d","year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.743465Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:48276a67e8200bf52cd5860e20d49b4316be8d765779e1f743157f346f81b309","observation_id":"f3ae12f5-5f68-42c8-b040-8a8916b2c07b","resolution":{"observed_at":"2026-08-11T22:51:12.367811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.354960Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"52709f01-5213-4114-8821-67cb6aacda76","year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.746344Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:2656c3c74633f5ea44b99db866ad4d66e624ff231d9c58052d74f730abd347ec","observation_id":"3cc13530-d148-47f9-a88c-90caab8fef4e","resolution":{"observed_at":"2026-08-11T22:51:12.358061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T22:51:11.749400Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.749400Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:4e6aab17f67b90ff2e77fb7e4d87d48c038dd8bf8983600b7a51e957db18d596","observation_id":"604fe72a-990a-44bf-a5b3-5b2f919b16ff","resolution":{"observed_at":"2026-08-11T22:51:11.749400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.753568Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.753568Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:ed1f47ab9abd711855d079ad24a6d0358c7a50be73c7479c7d90afddeb7f112f","observation_id":"51edff70-7685-45e7-81c3-482dcdb6b7cb","resolution":{"observed_at":"2026-08-11T22:51:11.753568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.337064Z","title":"Stable Diffusion 2.0 Release, 2022","venue":null,"work_id":"0450b4bc-d76c-47b5-998f-ce8cb101a9d4","year":2022},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.757006Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:2caa5d12309671bf7a6f4dda59990bba14ffa6a11be685334f8590ad297806ba","observation_id":"2d940805-e791-4ff3-8f01-eb3f97354397","resolution":{"observed_at":"2026-08-11T22:51:12.341114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.324967Z","title":"Galip: Generative adversarial clips for text-to-image synthesis","venue":null,"work_id":"6888caf8-9e0a-4a7f-84c7-d7bbdf8a3710","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.760544Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:e7e27ce94ff20bd3ae68fa1fdd14fff0caff11011a118751175cd68d076d6110","observation_id":"8c4b294e-7380-4d32-bce9-ee3cf89529b9","resolution":{"observed_at":"2026-08-11T22:51:12.328642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T22:51:11.763823Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.763823Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:23273e3c4c3d5e2ac2548a302d0a9080e8b918f7c8d453d8d1bd9c04f62b177d","observation_id":"9b869e0b-9656-42a2-a5a3-2275c644060a","resolution":{"observed_at":"2026-08-11T22:51:11.763823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.767558Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.767558Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:a3cd809af08e36a2ca5174b71bcc06046d9159384662dc20890209ab4dd48f7f","observation_id":"14280fb3-5cc0-48cf-b81b-a137f4750877","resolution":{"observed_at":"2026-08-11T22:51:11.767558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:51:11.770731Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.770731Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:e1ed8f3aae73eaada60c15b91503bdcd89e3738eb3f3a31175aa900c477196e1","observation_id":"8c8393dd-ca0a-4920-b893-cfee5060a49e","resolution":{"observed_at":"2026-08-11T22:51:11.770731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T22:51:11.774507Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.774507Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:a6684c7e92945403caf239f8ff64859d13aeac97f9c3e69ae21743c2d89d7a48","observation_id":"ebbd1558-1adf-4a4b-8507-97a12bac64dc","resolution":{"observed_at":"2026-08-11T22:51:11.774507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:11.778460Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.778460Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:f215058e4dcecef3ab762d7351cc73ad2fa43873ff0d0cbb89e5a38979fa6f39","observation_id":"d83c2f09-c7e3-4a8f-ac8b-42d26310f4ac","resolution":{"observed_at":"2026-08-11T22:51:11.778460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.301120Z","title":"Cogvlm: Visual expert for pretrained language models, 2023","venue":null,"work_id":"580ef1e5-68fb-42c6-93c8-af9eac677afc","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.781986Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:89597b5e22c459e88e4ccabf1505ed6e9a6eb86f0c66d1fe9fa0d356090a20ca","observation_id":"370095dc-e1e5-452a-ba97-170d31db0697","resolution":{"observed_at":"2026-08-11T22:51:12.305573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T22:51:11.786109Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.786109Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:172edba7c84fac86e21f2ec221bfd614acf531f7f003bec1c964c33e9837a5f3","observation_id":"b4c52a21-8243-4808-973b-25604af2bee3","resolution":{"observed_at":"2026-08-11T22:51:11.786109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.291135Z","title":"Grit: A gener- ative region-to-text transformer for object understanding","venue":null,"work_id":"33077c06-1483-4827-9326-2567a7fa14d3","year":2025},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.790031Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:739f01a1f855975cd846ac647f709465e8fd61e975032c00fc54a8826b482a86","observation_id":"a17778bf-b914-4a82-96f6-5f13fd06f7bf","resolution":{"observed_at":"2026-08-11T22:51:12.295080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14284","last_updated":"2025-05-06T16:45:30Z","snapshot_observed_at":"2026-08-13T05:18:41.544718Z","submitted_at":"2023-11-24T05:17:01Z","title":"Paragraph-to-Image Generation with Information-Enriched Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14284","snapshot_observed_at":"2026-08-11T22:51:11.793880Z","title":"Paragraph-to-image generation with information-enriched diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.793880Z"},"links":{"cited_paper":"/paper/2311.14284","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:1322b94deee3d8554de1e9cb3e3a087b856b52498002c1c079fd94776e3311ae","observation_id":"078ce21b-e4e4-407b-9b82-e25718a751a9","resolution":{"observed_at":"2026-08-11T22:51:11.793880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-11T22:51:11.797701Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.797701Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:d117f152c149247e0849ee325224986a8cd03b820c013ede7742ec2ccba36e93","observation_id":"02eba41d-9f32-41c5-9774-7c3e884688df","resolution":{"observed_at":"2026-08-11T22:51:11.797701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-11T22:51:11.800770Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.800770Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:3f757e46e3a685eed65d669663128319b8ad5f7bc13b61a26af3f9c811763976","observation_id":"b644eab3-2884-4903-a021-e10675749e39","resolution":{"observed_at":"2026-08-11T22:51:11.800770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T22:51:11.804287Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.804287Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:96f60efda31a51242f36e9572642e56e6bd17d4c83d241c4caef964f45eb4ba0","observation_id":"c6430e2a-71bf-494e-8f17-c1d6284c3712","resolution":{"observed_at":"2026-08-11T22:51:11.804287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-11T22:51:11.807591Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.807591Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:939822c1afb36128f97c48f57b6e9e3350362f11acd9c405c640962d767589da","observation_id":"f7e04b10-0996-4aa7-9f3e-29316a62060f","resolution":{"observed_at":"2026-08-11T22:51:11.807591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.281353Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"b68b1513-b426-4f05-a9fe-00d43fd694ab","year":2023},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.810768Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:8e617a388e5d325e49acd7dc91ae599e52b51e17911cfe0e84015b2ac3e40d38","observation_id":"2a3bf3b5-821a-428c-8285-f8604899fcdb","resolution":{"observed_at":"2026-08-11T22:51:12.284845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T22:51:11.813821Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.813821Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:aa4e330c6de86069951d5e7dd4a571b7935dfd9c6ad7a426d2b6cfd7f2698f2b","observation_id":"d22537aa-a24e-42e8-bc1b-85ac610b88c6","resolution":{"observed_at":"2026-08-11T22:51:11.813821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.269999Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"b479c955-8949-4e55-a507-dbdcf2b4a92e","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.818765Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:18d20ef10a2a7d050da31bbd9b3fa91e8b83dec3628bdd6280e46083c08e4edb","observation_id":"68908d34-bc99-438d-bc82-1be8c17d0042","resolution":{"observed_at":"2026-08-11T22:51:12.274098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07860","last_updated":"2024-03-12T17:50:11Z","snapshot_observed_at":"2026-08-13T00:55:51.263806Z","submitted_at":"2024-03-12T17:50:11Z","title":"Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07860","snapshot_observed_at":"2026-08-11T22:51:11.822595Z","title":"Bridging different language models and generative vision models for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.822595Z"},"links":{"cited_paper":"/paper/2403.07860","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:b86b328c7dba694410bb246792c3c76da5e27c7dc43f5fa799d61daefe75a3b1","observation_id":"560ddeec-0fa3-42e1-8d32-b12b9fe9caf4","resolution":{"observed_at":"2026-08-11T22:51:11.822595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20279","last_updated":"2024-10-23T02:38:44Z","snapshot_observed_at":"2026-08-12T23:53:57.003972Z","submitted_at":"2024-05-30T17:33:10Z","title":"CV-VAE: A Compatible Video VAE for Latent Generative Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20279","snapshot_observed_at":"2026-08-11T22:51:11.827049Z","title":"Cv-vae: A compatible video vae for latent generative video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.827049Z"},"links":{"cited_paper":"/paper/2405.20279","citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:86da723a41c45d8e18b1ab51eab7b213b55ee4fbe0327fd45b19467fba0db89a","observation_id":"f36d674f-0dae-4596-95b0-33d22e2afff5","resolution":{"observed_at":"2026-08-11T22:51:11.827049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.260210Z","title":"Open-sora: Democratizing efficient video production for all, march 2024","venue":null,"work_id":"76f6f507-1017-4dd2-9933-44888878b677","year":2024},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.831286Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:e5634a5c93a5209a78e5c4d54e276cc354dbe3b557c20db0236ebd3db378ecaf","observation_id":"1199afe8-f167-4d7b-abc3-248dd0a6b825","resolution":{"observed_at":"2026-08-11T22:51:12.263393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.250794Z","title":null,"venue":null,"work_id":"7807f669-a701-4335-a2c0-891ee729ab17","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.835420Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:0b702b96ce98d4a23cdf9382847f8240fd983be8b1eed439a548ab8b09323953","observation_id":"2fde7757-3226-4491-89de-2b0d958a469c","resolution":{"observed_at":"2026-08-11T22:51:12.254031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.239353Z","title":"• Videos with a motion score of 0, determined using optical flow, are excluded","venue":null,"work_id":"56e44184-bf8d-4506-b78d-a0d2d63415b3","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.839179Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:6a4d1e447313b3e67c7070454afd58aa519d9e8858b1ef7de6e544d4dbe9bbd9","observation_id":"f956b5f7-5c53-49a0-8f7e-41a835d0d893","resolution":{"observed_at":"2026-08-11T22:51:12.243362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.224914Z","title":null,"venue":null,"work_id":"48a4c196-0a8c-4790-afbc-8a26f01ae602","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.843069Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:97e0dbd7b0bc37e3f10a2659ff57d7918e71edce75adbf12f1136dfe5dc2fed4","observation_id":"8515fc69-f386-4409-8cea-ba987206a161","resolution":{"observed_at":"2026-08-11T22:51:12.231669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.213915Z","title":"Input text prompt","venue":null,"work_id":"5e8aefc4-865c-4cd8-8bf4-983f4fa08a57","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.847314Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:e591a821c539ffd6ffa3a6c20ac875fdb7c3d7ad2023171b75ecd2995a36df57","observation_id":"ed2bb0e4-2c56-40f2-a982-cc8cd9bf3c35","resolution":{"observed_at":"2026-08-11T22:51:12.217479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.202862Z","title":null,"venue":null,"work_id":"ca9eef30-2a7a-4a9f-84ec-eb621240be74","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.850609Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:4b553aa76e05958bdf49751abf1a2009ebe3e3f623f1c00fa19c3ad13983cc99","observation_id":"537e7d6e-a8cd-4598-83db-03bae41de380","resolution":{"observed_at":"2026-08-11T22:51:12.206404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.193494Z","title":"containing watermarks","venue":null,"work_id":"1756c3d6-b28f-415a-803a-fbdd1b4d097c","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.854420Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:a466bf295f37d890ee27fcc2f2bbcaaa955946b199ee1d676eb8208e69849502","observation_id":"a4417213-4970-4ef3-9ecb-4ba35cbc2b33","resolution":{"observed_at":"2026-08-11T22:51:12.196304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.182188Z","title":null,"venue":null,"work_id":"7cfbdc71-295c-4eda-aa4e-42ba92eecb90","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.858303Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:33d2921d5d373ec512289f7544617b3437789135bd60729f95774b414f42f4e9","observation_id":"b87fc7b9-720d-48af-8501-26cd4788d9ce","resolution":{"observed_at":"2026-08-11T22:51:12.186046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:51:12.168608Z","title":"top”, “ below","venue":null,"work_id":"052cccbc-af3b-4a58-9f61-67274bdace76","year":null},"citing_paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:51:11.861299Z"},"links":{"citing_paper":"/paper/2412.03085"},"observation_digest":"sha256:882ce030f319794df018c2c781c67c78ebbdc8abd53c7fcee5602b796a2cbe03","observation_id":"a99ad1bb-e85d-4473-823a-b87f226ba4cb","resolution":{"observed_at":"2026-08-11T22:51:12.173566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03085","last_updated":"2024-12-04T07:26:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T01:30:42.798942Z","submitted_at":"2024-12-04T07:26:44Z","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2412.03085."}