{"as_of":"2026-08-14T15:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9a20f7bd51a08ac6310bf8c51653125832c75dfc759539805db44c7d3a8329f","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T02:16:08.275374Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28611/citation-record","integrity":"/paper/2607.28611/integrity","json":"/paper/2607.28611/citation-record.json","paper":"/paper/2607.28611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.291402Z","title":"Gqa: Training generalizedmulti-querytransformermodelsfrommulti-headcheckpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.291402Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:2f2a84fc61c1d69343f48309d88cde575f5f2630ce2a7d21ef20cc675689ef4b","observation_id":"b3f1285a-a8d2-4f8f-a4b9-b9dcc1c0ed75","resolution":{"observed_at":"2026-07-31T02:16:07.291402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.326089Z","title":"Physics of language models: Part 4.1, architecture design and the magic of canon layers.Advances in Neural Information Processing Systems, 38:42349–42369, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.326089Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:a5a64107064cfe5cc4f6d0310040ba39aad6313dd0eab7ba1b11d19699a01ac9","observation_id":"96695258-4f06-4a0b-a373-f9ea6da9bf1f","resolution":{"observed_at":"2026-07-31T02:16:07.326089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-13T16:18:39.959474Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-07-31T02:16:07.387521Z","title":"Round and round we go! what makes rotary positional encodings useful?arXiv preprint arXiv:2410.06205, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.387521Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ee74cc86d06654310f4151dcf3c5abd2579b0ce8c11c0f3bb27a815ed07f0eb5","observation_id":"0d07a87d-a406-4eff-8c04-eb02c23dadc6","resolution":{"observed_at":"2026-07-31T02:16:07.387521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.457244Z","title":"FLUX.2: Frontier Visual Intelligence.https://bfl.ai/blog/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.457244Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:07e90f232759d1f8724d097cdef5d7245fee07ec201e4f7f461d8132c953f7be","observation_id":"a737b48e-98d1-426c-8c17-1cd3eae2f01d","resolution":{"observed_at":"2026-07-31T02:16:07.457244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-31T02:16:07.541093Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.541093Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:84d42dce2b423e9f16c8d8dfd0f3c19e1d365f4b8e7adc74da7df788143716e6","observation_id":"68d82e32-8e07-4210-894f-267e0498a709","resolution":{"observed_at":"2026-07-31T02:16:07.541093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.613961Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.613961Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:114ebbf4907e94faec2fb38a55e410452c9ed4802a1901361cb1853303086227","observation_id":"29be113c-67ae-43d7-911f-a3b992baf929","resolution":{"observed_at":"2026-07-31T02:16:07.613961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.660028Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.660028Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:4535365ee382803e4b0a4f2bf988bb576f086363fe1d5b2527b570340fae19b4","observation_id":"6d331e3b-93dd-4ff1-86b7-504d7c3dd1c5","resolution":{"observed_at":"2026-07-31T02:16:07.660028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-13T02:23:40.621810Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-31T02:16:07.719858Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer.arXiv preprint arXiv:2511.22699, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.719858Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:b5f3929f9b7212f4f722cb26ca904fb291523137466e8f94d69502fbeeef8079","observation_id":"30e953e9-3eaf-4b06-8b0d-d25ac09c1202","resolution":{"observed_at":"2026-07-31T02:16:07.719858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01642","last_updated":"2026-05-07T23:28:50Z","snapshot_observed_at":"2026-08-13T00:23:14.989193Z","submitted_at":"2026-02-02T04:59:24Z","title":"The Effect of Mini-Batch Noise on the Implicit Bias of Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01642","snapshot_observed_at":"2026-07-31T02:16:07.806062Z","title":"The effect of mini-batch noise on the implicit bias of adam.arXiv preprint arXiv:2602.01642, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.806062Z"},"links":{"cited_paper":"/paper/2602.01642","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:9a08c915ac87b142d37d20ef812c1d57ec8bb6076dacb15bc1274e3a4d3e35bd","observation_id":"ef575262-d288-4069-b27f-0b5ed773a300","resolution":{"observed_at":"2026-07-31T02:16:07.806062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.841398Z","title":"Aligning visual foundation encoders to tokenizers for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.841398Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:67055d6d34119b5736d9998631cff1816d496bbcaad097f33d2cececd7a1de92","observation_id":"fab3edf1-56a2-4e90-9f61-a2f66ca0cb59","resolution":{"observed_at":"2026-07-31T02:16:07.841398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.903452Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.903452Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:bf371ddcba89c8d238f5d2a41b9f1260cf46e048705bd9e7997232d0a3c97b84","observation_id":"36fa5535-064a-4f56-bae4-85e122f790c2","resolution":{"observed_at":"2026-07-31T02:16:07.903452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.957963Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.957963Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:479fb72399ac35989c5b60465c6e17f35d6589124fda7bf676689b6f169fb177","observation_id":"c3940baf-8bf9-44d4-a4d8-f8dc42210c58","resolution":{"observed_at":"2026-07-31T02:16:07.957963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.961114Z","title":"Sana-video: Efficient video generation with block linear diffusion transformer.arXiv preprint arXiv:2509.24695, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.961114Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:68852f7a070a0dfc8fe5ad8721369eff3f1609ac58b6bea64b0fe800b241c86d","observation_id":"23fc2699-5ddc-4f6c-8ed8-89242d511d5b","resolution":{"observed_at":"2026-07-31T02:16:07.961114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-31T02:16:07.963748Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.963748Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:7f613dd6d2bf0e3a1b2bc0d280f52cd6a223e6ff49622d82716dac94ba669164","observation_id":"953987e6-b508-4a14-8bd5-ddcd18846e6f","resolution":{"observed_at":"2026-07-31T02:16:07.963748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.966909Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.966909Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:3bd48fbe340973afa89a178a598a44ba47c2aa0d5e5de92ecae70fe3b2ee75e7","observation_id":"efe1d071-f925-4e60-ae13-7cf14f5bb61f","resolution":{"observed_at":"2026-07-31T02:16:07.966909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09151","last_updated":"2023-04-18T17:45:50Z","snapshot_observed_at":"2026-08-13T11:59:59.704743Z","submitted_at":"2023-04-18T17:45:50Z","title":"UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09151","snapshot_observed_at":"2026-07-31T02:16:07.969747Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining.arXiv preprint arXiv:2304.09151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.969747Z"},"links":{"cited_paper":"/paper/2304.09151","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:e17362fddfebef539c40c06247ebc2108f7194f26de45cafb8d9b31640d0b69f","observation_id":"8674616c-2509-4dbd-903f-49993d1da42a","resolution":{"observed_at":"2026-07-31T02:16:07.969747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.973704Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.973704Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:6efc8cc3597446bcdbd433733798162d083a4b300d4d42f6821b78309e86ff76","observation_id":"edcd3dbe-525e-4544-9742-04d20e705ff7","resolution":{"observed_at":"2026-07-31T02:16:07.973704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.976481Z","title":"Don’t be lazy: Completep enables compute-efficient deep transformers.Advances in Neural Information Processing Systems, 38:137707–137739, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.976481Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ae55bce6309ad01301b3f4b6d3e79e5338ba785d455f66e031a82a047e5ba500","observation_id":"f9116ccc-38c1-471e-9fd3-d8c5c2c9643f","resolution":{"observed_at":"2026-07-31T02:16:07.976481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.979224Z","title":"Diffusion models beat gans on image synthesis.Advances in neural information processing systems, 34:8780–8794, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.979224Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:3d8d3ca33953eb434b9882bc936a5b4bdc8a2bbad546f73ddb50f066bde028c8","observation_id":"ac60a4be-a081-44c8-b2a8-03848e0a3802","resolution":{"observed_at":"2026-07-31T02:16:07.979224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.982181Z","title":"Diffusion is spectral autoregression.https://sander.ai/2024/09/02/spectral-autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.982181Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:bacfd74e73bb462bfb3f96f1afd96fdea56098fa5ff2d9b31f963d7435535f16","observation_id":"99b7920e-3e6b-4a0c-93f4-60cd195bd1c6","resolution":{"observed_at":"2026-07-31T02:16:07.982181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-10T08:45:38.806056Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06155","snapshot_observed_at":"2026-07-31T02:16:07.984738Z","title":"Efficient-vdit: Efficient video diffusion transformers with attention tile.arXiv preprint arXiv:2502.06155, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.984738Z"},"links":{"cited_paper":"/paper/2502.06155","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:c7946985818664932ce25379c3725f3ea4c91884847b83e30d5af2bc90907035","observation_id":"2ed05fa7-6588-4b8f-a38b-f139a7e59178","resolution":{"observed_at":"2026-07-31T02:16:07.984738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.987633Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.987633Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:5ce58a9f8af508e6c7f02ba47bbe7e89ea7a0602620772f73d8223f278aa8134","observation_id":"28838b84-62cb-4cdc-8185-7ac6cda2c1b3","resolution":{"observed_at":"2026-07-31T02:16:07.987633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.990174Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 1(1):12, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.990174Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:6fb4f8f15ed3ac87fcb36f6af17e2016c0735186030f7222bae56457438ad977","observation_id":"ff79909b-1e87-4091-a68a-c00474cf92a1","resolution":{"observed_at":"2026-07-31T02:16:07.990174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.992876Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.992876Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:37335ac3ee82bc21ebe297c42a84b059e5c8847703a24a6d0ea9eaaca3e145bf","observation_id":"671d716e-8ae5-4088-a419-c54af8afa06b","resolution":{"observed_at":"2026-07-31T02:16:07.992876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.996132Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.996132Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:b530a2725dead766ae7b62c2222943b83edfb5cf4867f5c9ff1619725e351ae9","observation_id":"b81ca4ad-de40-42c4-b0ed-2f7a2faeed45","resolution":{"observed_at":"2026-07-31T02:16:07.996132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:07.998823Z","title":"Scaling diffusion transformers to 16 billion parameters, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:07.998823Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:95b7fd64d6e7cf2a4ec27638c155cd03b64a936a4eb0f187d15781eb01ad8154","observation_id":"f0ee9087-c842-4324-ba7c-9f8d3087430b","resolution":{"observed_at":"2026-07-31T02:16:07.998823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21739","last_updated":"2026-05-11T08:05:21Z","snapshot_observed_at":"2026-07-06T22:43:30.761426Z","submitted_at":"2026-01-29T13:56:11Z","title":"Why Adam Works Better with $\\beta_1 = \\beta_2$: The Missing Gradient Scale Invariance Principle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21739","snapshot_observed_at":"2026-07-31T02:16:08.001681Z","title":"Why adam works better with beta1=beta2: The missing gradient scale invariance principle.arXiv preprint arXiv:2601.21739, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.001681Z"},"links":{"cited_paper":"/paper/2601.21739","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:346a8e7d63ae68224159a74aa86b2e20fd8949ba8ac2704db09990048106950a","observation_id":"446d8ba5-35f7-4ccb-9656-986942f894cd","resolution":{"observed_at":"2026-07-31T02:16:08.001681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.004957Z","title":"Geneval: Anobject-focusedframeworkforevaluatingtext-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.004957Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:70310920d05993803cc2a2b0ec8b434b22f1af9eacc94afd825a802fe5f22085","observation_id":"0ce817d8-e67d-46df-9eb4-370966ed2a94","resolution":{"observed_at":"2026-07-31T02:16:08.004957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-07-31T02:16:08.007646Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.007646Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ff4240847b75c59a37cf0cb2f430397612e60743ab21d9133f6c7eb5b7eec171","observation_id":"671749fa-901a-4d51-ae7b-6987ce5f36a0","resolution":{"observed_at":"2026-07-31T02:16:08.007646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-07-31T02:16:08.010546Z","title":"Scaling laws for autoregressive generative modeling.arXiv preprint arXiv:2010.14701, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.010546Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:0f6a9220b0a0ebd3e5aa9ef366fb9b3dd66f69c86ff663d541ac43a72e2f1809","observation_id":"1b633e07-6b12-4c58-ac5e-566d2fb7de99","resolution":{"observed_at":"2026-07-31T02:16:08.010546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-31T02:16:08.013539Z","title":"Deep learning scaling is predictable, empirically.arXiv preprint arXiv:1712.00409, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.013539Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:dd143e7969c02348b7a9045f3197db0aea889be3c3ccd6a292edc943078ed9cb","observation_id":"6986aedf-9bec-42d7-ad5b-7ffa62020ef6","resolution":{"observed_at":"2026-07-31T02:16:08.013539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-31T02:16:08.016487Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.016487Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:9a11b192ff1ff4f2e63c44340eb86b4cce72b6e43d96fec0b5d41005bedc65f9","observation_id":"d7e826fe-f2ee-40ab-a17b-119ab4738c20","resolution":{"observed_at":"2026-07-31T02:16:08.016487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.019392Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.019392Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:4b580a9d62cc375f822871ac7f22ba0d00187187378cd43f3c3cb1b48c379d91","observation_id":"d368d901-0493-44a1-b018-5a816f0e4934","resolution":{"observed_at":"2026-07-31T02:16:08.019392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-31T02:16:08.022280Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.022280Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:844da4cae2215e9ae30f3d02403709f44c8a4b3dc5404a2527f199477a79b59c","observation_id":"58a6f19e-8edf-4053-9290-88b2b7f56191","resolution":{"observed_at":"2026-07-31T02:16:08.022280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.025391Z","title":"Videodiffusionmodels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.025391Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:fd4d978f0cc2b421199b2c1b878b11982c0c38a8da60711945bc23d43b9ef23c","observation_id":"5ed24407-67a4-49d0-aaed-2698296a6679","resolution":{"observed_at":"2026-07-31T02:16:08.025391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-31T02:16:08.035084Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 10, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.035084Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:7ac7c1091808b8d212cff57e0e13be09a2f1b1ee480a0a1d533c30e1cb915be7","observation_id":"9f224e44-c918-49f2-8d50-51c96bbc222f","resolution":{"observed_at":"2026-07-31T02:16:08.035084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00972","last_updated":"2025-02-03T00:51:09Z","snapshot_observed_at":"2026-08-13T22:38:48.504937Z","submitted_at":"2025-02-03T00:51:09Z","title":"Pushing the Boundaries of State Space Models for Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00972","snapshot_observed_at":"2026-07-31T02:16:08.038112Z","title":"Pushing the boundaries of state space models for image and video generation, 2025.https://arxiv.org/abs/2502.00972","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.038112Z"},"links":{"cited_paper":"/paper/2502.00972","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:11919011fa5308ba39f5e7731f41945dfa56e43d8cdc9a4a13dcf837390b7bf5","observation_id":"de8a3529-9465-4022-873d-0a7b8af82577","resolution":{"observed_at":"2026-07-31T02:16:08.038112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.041706Z","title":"Relic: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.041706Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:5048bc566f1924a28b87abae299a5b4a8b728dbdd1fef6425848cfce164f8eb6","observation_id":"907bfc44-2e6c-438d-b7cf-8da6a3be8b97","resolution":{"observed_at":"2026-07-31T02:16:08.041706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.044262Z","title":"Zigma: A dit-style zigzag mamba diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.044262Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:387f9f7837f9b4059dedb97b40f280649413f9ec33c530a2db426997b676cd03","observation_id":"854dee7c-e799-4fb1-9465-644bbdb961fd","resolution":{"observed_at":"2026-07-31T02:16:08.044262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-31T02:16:08.046825Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.046825Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:d51fd1f237b0649638102957f79837232a7353ed5ce9dfee11f704167ca9745c","observation_id":"347a662c-4aac-44ba-9bb8-68c2c9a11862","resolution":{"observed_at":"2026-07-31T02:16:08.046825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.050076Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.Advances in Neural Information Processing Systems, 38:167283–167308, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.050076Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:38261d6aa4ef68b64d384296cce5aae842ed695b38bbe6e29a87786a4da1af95","observation_id":"d0b02c73-1eb9-4353-861d-530ca9f69023","resolution":{"observed_at":"2026-07-31T02:16:08.050076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.052719Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024.URL https://kellerjordan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.052719Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:1b5e562b611b09bf309a5fe0d833d0642f90e2e4d3d4229baaccf35b630e1627","observation_id":"afbafc47-653c-4a81-99c9-8a190606c0a9","resolution":{"observed_at":"2026-07-31T02:16:08.052719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20360","snapshot_observed_at":"2026-07-31T02:16:08.055344Z","title":"Editverse: Unifying image and video editing and generation with in-context learning.arXiv preprint arXiv:2509.20360, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.055344Z"},"links":{"cited_paper":"/paper/2509.20360","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:2898904a2722bb510f40046aa03e05322191f610d1d453a215583c3b4ef53640","observation_id":"1a9554c0-a78e-4a22-ac5f-0dab9b9d65ca","resolution":{"observed_at":"2026-07-31T02:16:08.055344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-31T02:16:08.058662Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.058662Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:2982b7f20d38c89c7fe470b09c0c87f2c6f961f48959f60d7e68b5e766efb323","observation_id":"43f4c58a-6810-4bfe-adda-4ece00621794","resolution":{"observed_at":"2026-07-31T02:16:08.058662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.061609Z","title":"Transformers are RNNs: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.061609Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:7c1a9778924b0ccb22e17c82235bc667c2ffdb67ea6c35ccf8059056cc84c2da","observation_id":"a8164523-4a2b-4b2f-b976-2d7b763f56dc","resolution":{"observed_at":"2026-07-31T02:16:08.061609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.064097Z","title":"Theimpactofpositional encoding on length generalization in transformers.Advances in Neural Information Processing Systems, 36:24892–24928, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.064097Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:c21644136af712fab6bd43f9193c907ba743b80f2d6c974764002615655173a5","observation_id":"59fdf7c9-40b3-47c4-8afd-de47f0065aa7","resolution":{"observed_at":"2026-07-31T02:16:08.064097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-07-31T02:16:08.069668Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding.arXiv preprint arXiv:2006.16668, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.069668Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:c12aa222bfe5d1c169bf4fe9c499953aeb668e96a251c3307bea89256560c93f","observation_id":"687323ae-9ce3-4040-b70f-896365421064","resolution":{"observed_at":"2026-07-31T02:16:08.069668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.072710Z","title":"Back to basics: Let denoising generative models denoise","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.072710Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:f4465a4728b99120d2e40591c2ec7a69d47014656b1bf6bd90d299da80e84fc8","observation_id":"9cff701e-1901-46ce-971c-f471979af551","resolution":{"observed_at":"2026-07-31T02:16:08.072710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.075575Z","title":"Scalinglawsfordiffusiontransformers.arXivpreprintarXiv:2410.08184, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.075575Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:c51f9e9db2b4570a77a4b6afd82743643b8f0f3009602ef952fdc6e4cd35f44e","observation_id":"1599da00-1c66-4942-8bfc-6092dc53883f","resolution":{"observed_at":"2026-07-31T02:16:08.075575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-31T02:16:08.108176Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.108176Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:167ed811a1b3dec7e05e0bd2145473d05afc4328529abcf0cac686b7ba0f4a2d","observation_id":"1fe38c64-c4d4-47a9-92b6-d6260e640913","resolution":{"observed_at":"2026-07-31T02:16:08.108176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-07-31T02:16:08.114735Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.114735Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:4b152b9bdc9e39a9cb104ba6f7365fdf98af1129f8e748b6a25c9f72636a5418","observation_id":"4c800bfc-44b0-41b5-ad7e-75edf89c5063","resolution":{"observed_at":"2026-07-31T02:16:08.114735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T02:16:08.125037Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.125037Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:8cd281b1e5771b1aedd4f77eaf4aca89c54b823ab3fc39b79dfd706c76ad24f6","observation_id":"ab65fb43-f2e6-4737-b465-bf4a20dafbb7","resolution":{"observed_at":"2026-07-31T02:16:08.125037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-12T08:24:59.243273Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-31T02:16:08.128479Z","title":"Deepseek-v3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.128479Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:e1dfe4b5664fcdcb90065900d0c952d42059d8b10192ebe061d59c2276abbf18","observation_id":"4d9fb7bd-8261-4275-adfe-c6333a4ba733","resolution":{"observed_at":"2026-07-31T02:16:08.128479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-31T02:16:08.131544Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.131544Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:8d1a6341163ea125be09c03c96265dfe3a8d02df8d6996694717507526c692c2","observation_id":"92036d02-b64c-4ea5-a004-471275f9a9ca","resolution":{"observed_at":"2026-07-31T02:16:08.131544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.134615Z","title":"Vmamba: Visual state space model.Advances in neural information processing systems, 37:103031–103063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.134615Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:774d3f1eb30f42a649b1ec6c342bd5bb25a1bb5b29d4b8ae5dda1a6c4211407f","observation_id":"4bae04a0-1abc-43d3-8ca3-84f29ebf7d69","resolution":{"observed_at":"2026-07-31T02:16:08.134615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03444","last_updated":"2026-06-15T18:55:41Z","snapshot_observed_at":"2026-07-13T13:22:23.195279Z","submitted_at":"2026-04-03T20:36:34Z","title":"Olmo Hybrid: From Theory to Practice and Back","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03444","snapshot_observed_at":"2026-07-31T02:16:08.137640Z","title":"Olmo hybrid: From theory to practice and back.arXiv preprint arXiv:2604.03444, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.137640Z"},"links":{"cited_paper":"/paper/2604.03444","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:4e827b008f79fb1fce6879d97d3d5a2d7b4e7dbfc7df707cb67309046e369574","observation_id":"12de7f78-7b2e-4d10-a181-28fc38675a27","resolution":{"observed_at":"2026-07-31T02:16:08.137640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.140944Z","title":"Completed hyperparameter transfer across modules, width, depth, batch and duration.arXiv preprint arXiv:2512.22382, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.140944Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:e6ae6b4f364324c4bceab11961816c16c394717540d8ce3cc5e7c658d9c23c0d","observation_id":"0b914026-664f-43da-91dc-1397d6ac4913","resolution":{"observed_at":"2026-07-31T02:16:08.140944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-07-31T02:16:08.143885Z","title":"Glide: Towardsphotorealisticimagegenerationandeditingwithtext-guideddiffusionmodels.arXivpreprintarXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.143885Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:01f1cb7477baf9ceb6568dc63112421227495571e811c8acaa42ee0dc80c3f2f","observation_id":"212799eb-a387-45c3-a07e-2dd1616da5c8","resolution":{"observed_at":"2026-07-31T02:16:08.143885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.147126Z","title":"Improveddenoisingdiffusionprobabilisticmodels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.147126Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:86aa39151c9f4be5bb8b63952b3c5347b096c36fa05885f81599a6e2406f2db8","observation_id":"0d656b73-33cd-494f-88f9-5966961b6d29","resolution":{"observed_at":"2026-07-31T02:16:08.147126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-31T02:16:08.149754Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.149754Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:62fc17cc8f656076968d3407a7a3c17f4f9b37a90e54058fae1541b82e3f9f5b","observation_id":"8151033e-a9de-42d0-b2bd-8c0c052c7735","resolution":{"observed_at":"2026-07-31T02:16:08.149754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.152730Z","title":"In search of adam’s secret sauce.Advances in Neural Information Processing Systems, 38: 63404–63442, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.152730Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:f23868a7ed9d6953353474b336b3627a4caa1521b38d1054ce4bba386af6ea6b","observation_id":"8a8e47bb-4377-48bb-9e15-e984c14596f8","resolution":{"observed_at":"2026-07-31T02:16:08.152730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.155647Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.155647Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:813b96531edd88c8af9dd2eaf1833e7306103ee7ade3768dfa750c39dd943f3d","observation_id":"7c7a5ff3-66bd-4dc0-a055-d7724dd27987","resolution":{"observed_at":"2026-07-31T02:16:08.155647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.158345Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.158345Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ae1142dfa949e4b44d8b34e87d6d9a573ec86d5d114c4d7aa1e8f65146192c6d","observation_id":"42be2ed3-3502-4058-a0a4-6253d0ad9e89","resolution":{"observed_at":"2026-07-31T02:16:08.158345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.161196Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21 (140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.161196Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:d63e5c56731aa9ae5b9e91f1037385c681b1adb159c332b1a7d9fde83202d4ca","observation_id":"efdae082-a1d8-4568-982f-8cfc99517b03","resolution":{"observed_at":"2026-07-31T02:16:08.161196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-31T02:16:08.163727Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.163727Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:528adca0b88108345eadbce1b3e877393401dd81ae2d94232783664c1b50c71d","observation_id":"f165b87e-08ef-49b9-aa6f-2f217c342229","resolution":{"observed_at":"2026-07-31T02:16:08.163727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.166787Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.166787Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:84baa1c8a3617dbe26c13f2973b220ca9d839d99b04a27b68875b0e29db900a1","observation_id":"8cd5d4c0-51d7-434e-8f5f-2b421631129c","resolution":{"observed_at":"2026-07-31T02:16:08.166787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.169494Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.169494Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:03207156c0a64b27419449354cbe7b1a3a2d21a38a06943f63859f6d8534f577","observation_id":"acc1cb7e-8e03-4849-8d53-eeb3e2d3cca8","resolution":{"observed_at":"2026-07-31T02:16:08.169494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-07-31T02:16:08.172183Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.172183Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:fe39704b599daa081a267fd81cac9f88fbf9b769e2e4cc96b3db46fa9fa4dfcc","observation_id":"0493f57c-70eb-42ea-96f8-66c62baa9b60","resolution":{"observed_at":"2026-07-31T02:16:08.172183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-31T02:16:08.175141Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.175141Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:1892e18bd40ab4114829be1e1afb9c45d7ae00a8476dfb41313a11eee05a9e12","observation_id":"f4c7ed8b-d3a9-4ee9-989f-d43470775374","resolution":{"observed_at":"2026-07-31T02:16:08.175141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-31T02:16:08.178098Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.178098Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:32f90999204f6dfc5a7ba80a7f9ab45867aa3001e1c6a21ae7568c7c881367b4","observation_id":"9ca1d191-b33b-4f77-b079-4ad0d40e6e08","resolution":{"observed_at":"2026-07-31T02:16:08.178098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-13T16:17:52.423891Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-07-31T02:16:08.181000Z","title":"History-guidedvideodiffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.181000Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ce78ec560d12fb6b7f1f5b2e183cd4880af7091c11dd2a2dc810350e8451441c","observation_id":"89d519d2-650e-482b-86ac-a7cfc9d78284","resolution":{"observed_at":"2026-07-31T02:16:08.181000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-07-31T02:16:08.183994Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.183994Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:bb89a6b4e89b08556938f146164d548cf9b11fc36d3efe8dea7aabc0e7bbf486","observation_id":"448d3f28-3376-4196-bdc9-3f608c766d96","resolution":{"observed_at":"2026-07-31T02:16:08.183994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.187004Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.187004Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:9ca82120bbb4f05078358db28e97769894b3b9757dcb64e62a4f41b5e8ad7f00","observation_id":"94342501-a152-46bb-90b4-b7f4cc4a6ec6","resolution":{"observed_at":"2026-07-31T02:16:08.187004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-31T02:16:08.189565Z","title":"Retentivenetwork: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.189565Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:17567251c32ed5410f6c08b1f6307c56a2c8b53a78e557ac8c0cd839df1de990","observation_id":"0ee61b72-b472-43af-b6ea-35b1efb7a054","resolution":{"observed_at":"2026-07-31T02:16:08.189565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.192329Z","title":"Dsv: Exploiting dynamic sparsity to accelerate large-scale video dit training.arXiv preprint arXiv:2502.07590, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.192329Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:6afafed4010cc5f6ee150f730bc879ace37e822b1ded1d180388b5cb2fce8a9b","observation_id":"e51f221d-5cc8-46df-9a7a-a6308546798d","resolution":{"observed_at":"2026-07-31T02:16:08.192329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.198077Z","title":"Kimi k3: Open frontier intelligence, 2026.https://arxiv.org/abs/2607.24653","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.198077Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:285362946a348cf8a123000c48485409ad42775b26e52d17aec21b3b7f0c20e8","observation_id":"db331e8e-1600-4fca-90d1-71d58df648a2","resolution":{"observed_at":"2026-07-31T02:16:08.198077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-31T02:16:08.200768Z","title":"Kimi linear: An expressive, efficient attention architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.200768Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:8be4d8308bf6c7c79e218908919bb8702f46a64f7ddac196f29c3e56fcfbdabf","observation_id":"cee43a81-79fd-4491-bbc7-17946f0ff2af","resolution":{"observed_at":"2026-07-31T02:16:08.200768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-07-31T02:16:08.203599Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.203599Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:78912b64f28e942420c831fe1794f5fc8c4d2abdb39eef59a8f066ecc4147713","observation_id":"69380636-d526-4efb-baa6-b7f03c974c2a","resolution":{"observed_at":"2026-07-31T02:16:08.203599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.213747Z","title":"Hunyuanvideo 1.5 technical report, 2025.https://arxiv.org/abs/2511","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.213747Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:438230b7f5d1e64b7ef8185c029de80ee63188d6cef5a5ad825a759acf46150a","observation_id":"f7183d94-e7ab-4d8d-bdba-4e77f9bd0d92","resolution":{"observed_at":"2026-07-31T02:16:08.213747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.217148Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.217148Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:1c5b94be983eafd67818270ebcc1997f962a3e6460efa2b236ac8b0347e62f5d","observation_id":"18c04200-4605-452c-ba69-7a8fc7bf8e82","resolution":{"observed_at":"2026-07-31T02:16:08.217148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-31T02:16:08.219923Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.219923Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:646f8b0f5b3ae960e2290335a33ef5ac32711ea45f9a753041f2c130571760ec","observation_id":"94a2fd28-715b-4fce-a1cb-909bf7fdcc05","resolution":{"observed_at":"2026-07-31T02:16:08.219923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.223627Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computational complexity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.223627Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:5ceed9db0900139cb57eec147d6646b865a9ba763462b09ff1f4a043682b1451","observation_id":"5c8f58a3-e9c7-45a3-bd6f-16f0cc273bbd","resolution":{"observed_at":"2026-07-31T02:16:08.223627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-12T02:06:47.218918Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-07-31T02:16:08.227426Z","title":"Auxiliary-loss-free load balancing strategy for mixture-of-experts.arXiv preprint arXiv:2408.15664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.227426Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:de8fed071b0a718582efc2dc0df3311861edb777ff16af7462f723a7743ad627","observation_id":"b71a8927-3d4a-4512-9cbf-46e288aecc79","resolution":{"observed_at":"2026-07-31T02:16:08.227426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T02:16:08.230561Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.230561Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:86eabb024e938242231590379fe6bf02eb9edc868084bffeb8435d37aa24ad22","observation_id":"945ca130-8d03-433a-b5ba-12e39e89a6d8","resolution":{"observed_at":"2026-07-31T02:16:08.230561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.233526Z","title":"Scaling laws, carefully.lilianweng.github.io, June 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.233526Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:fa6f05e59497d7cf0237edf5d65463ba723ee9f9e587f7cdb27824dd3a91c90a","observation_id":"5afe614a-3d6a-4bdf-8a7a-c838d0837cf8","resolution":{"observed_at":"2026-07-31T02:16:08.233526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-31T02:16:08.236568Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.236568Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:22e096bf130668038fc3499336ee8221459cc4da0f6271e998bc23aed7f52d50","observation_id":"18181547-990b-45f6-9678-de8b78d31882","resolution":{"observed_at":"2026-07-31T02:16:08.236568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23858","last_updated":"2025-06-30T13:52:31Z","snapshot_observed_at":"2026-08-13T10:05:20.541835Z","submitted_at":"2025-06-30T13:52:31Z","title":"VMoBA: Mixture-of-Block Attention for Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23858","snapshot_observed_at":"2026-07-31T02:16:08.239355Z","title":"Vmoba: Mixture-of-block attention for video diffusion models.arXiv preprint arXiv:2506.23858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.239355Z"},"links":{"cited_paper":"/paper/2506.23858","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:0f1cb3c27565dfa1f139f5efe76ee7984ac167b7e52e0d31fcfd1066ea343b16","observation_id":"7f634608-880a-4d02-b295-6ed5f131e32f","resolution":{"observed_at":"2026-07-31T02:16:08.239355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01776","last_updated":"2025-04-27T00:10:11Z","snapshot_observed_at":"2026-08-13T13:28:15.450370Z","submitted_at":"2025-02-03T19:29:16Z","title":"Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01776","snapshot_observed_at":"2026-07-31T02:16:08.242540Z","title":"Sparse videogen: Accelerating video diffusion transformers with spatial-temporal sparsity.arXiv preprint arXiv:2502.01776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.242540Z"},"links":{"cited_paper":"/paper/2502.01776","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:60db8661e13c03b092470ea551a4be0546ca08b83338595fdde6f06b15626e8e","observation_id":"9f33261d-732d-49fe-878b-39018db1bfa9","resolution":{"observed_at":"2026-07-31T02:16:08.242540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-07-31T02:16:08.245486Z","title":"mhc: Manifold-constrained hyper-connections.arXiv preprint arXiv:2512.24880, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.245486Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:80cc71a97e54ec5a5057cfc82b1448da1e3dc057c84aad37fcbff2b5ce14378a","observation_id":"6d45c22b-788f-44f7-9d0b-50113234b865","resolution":{"observed_at":"2026-07-31T02:16:08.245486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T02:16:08.248478Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.248478Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:8ba29b37dcf332f0b9c8c34c00d4d768f2e4b80fab6a5fe666dff97b47adef09","observation_id":"63a96bc9-3167-463c-91a2-d6803eb34016","resolution":{"observed_at":"2026-07-31T02:16:08.248478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.251304Z","title":"Tuning large neural networks via zero-shot hyperparameter transfer.Advances in Neural Information Processing Systems, 34:17084–17097, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.251304Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:58e865c642eb5b439b835127e7d1f7b701f8d9e172d0a976207d69944f3ffc6e","observation_id":"87e6a1ac-b78f-4ea7-964a-0246e98ecbed","resolution":{"observed_at":"2026-07-31T02:16:08.251304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-13T23:41:36.523890Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-31T02:16:08.253839Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.253839Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:bdcf503970f858732b455b4d1a353371c3c78d41fc354cf181330db2efc8496b","observation_id":"f9cc9133-94d9-4698-a52f-d1cec4bca3cb","resolution":{"observed_at":"2026-07-31T02:16:08.253839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.256882Z","title":"Parallelizing linear transformers with the delta rule over sequence length.Advances in neural information processing systems, 37:115491–115522, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.256882Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:9c753594b772a10cf97d6069903d9bf948035723747e8310298281296ec745e2","observation_id":"6e73d0fd-b071-4be4-b8bc-1c395b8298f9","resolution":{"observed_at":"2026-07-31T02:16:08.256882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.259508Z","title":"Cogvideox: Text-to-videodiffusionmodelswithanexperttransformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.259508Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:0ae22b7792c41e58c6bb2003d7492fec2ec0f836099acb488fb9e1e514a0259d","observation_id":"9828ea82-a305-4572-b5ab-f0574a808a06","resolution":{"observed_at":"2026-07-31T02:16:08.259508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.262096Z","title":"Pixeldit: Pixel diffusion transformers for image generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.262096Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:4009f731f1505365b55bc30d16c63546865c8fdf5960f14932e995a97bfdd9c7","observation_id":"2002f6bb-7974-458f-918f-692d43cc7710","resolution":{"observed_at":"2026-07-31T02:16:08.262096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.265084Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.265084Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:41149e9ff0df471e217b0cbd4e45b58ac0fbf9bc8b9dc9f7233d1e691db1c370","observation_id":"55100718-4c93-403c-94ee-f06d3b4153f6","resolution":{"observed_at":"2026-07-31T02:16:08.265084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.267705Z","title":"Bidirectional sparse attention for faster video diffusion training.arXiv preprint arXiv:2509.01085, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.267705Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:130d989853a6db971023e910b2f65aecfa2f432196140ebec70fd900daae4a50","observation_id":"d12d853a-dc80-4086-a18f-c623c53a8907","resolution":{"observed_at":"2026-07-31T02:16:08.267705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06001","last_updated":"2025-08-08T04:06:08Z","snapshot_observed_at":"2026-08-05T23:04:15.876809Z","submitted_at":"2025-08-08T04:06:08Z","title":"KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06001","snapshot_observed_at":"2026-07-31T02:16:08.270116Z","title":"Knapformer: An online load balancer for efficient diffusion transformers training.arXiv preprint arXiv:2508.06001, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.270116Z"},"links":{"cited_paper":"/paper/2508.06001","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:cd438b35db42823696ce08282990547c48109f0944629ada4855d2ae2e60497b","observation_id":"fc1da28f-177a-49d9-83a5-abc89bf29834","resolution":{"observed_at":"2026-07-31T02:16:08.270116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:16:08.272881Z","title":"Faster video diffusion with trainable sparse attention.Advances in Neural Information Processing Systems, 38:152509–152534, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.272881Z"},"links":{"citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:a91bb911a43bbedbd178d834400ef014a0b8028526435f0f3d1584c40292fdd7","observation_id":"a50d4019-bb90-4f5f-a6af-cf9dcc048071","resolution":{"observed_at":"2026-07-31T02:16:08.272881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-31T02:16:08.275374Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.275374Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:5d220c757129974085e5b6957c92746789ae62e84acc3070ee63f17245058223","observation_id":"c1480be5-84c7-4953-8ea8-a5de0a860c4a","resolution":{"observed_at":"2026-07-31T02:16:08.275374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T18:00:04.854744Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 0 inbound Pith citation observations for arXiv:2607.28611."}