{"as_of":"2026-08-08T19:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28ca19b3781abd6a16bb51dadba8b2ef0aef9e7c24b57cdaa6448cb8223281f7","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:51:00.344231Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.01608/citation-record","integrity":"/paper/2601.01608/integrity","json":"/paper/2601.01608/citation-record.json","paper":"/paper/2601.01608"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:53.892703Z","title":"Self-rectifying diffu- sion sampling with perturbed-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:53.892703Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:e14c2936dc55ca59b7b2198ecc6705c2b9a2cd9f49b1c6b4e0a196d06354e8c3","observation_id":"a6373c6f-2ae8-436d-b33b-5d79ac7069a0","resolution":{"observed_at":"2026-08-03T12:50:53.892703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-03T12:50:54.037292Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions.arXiv preprint arXiv:2303.08797, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.037292Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:a07dbacb8f9fcf24f8fa5bd301a6e7c262d65cee161a9e8399e33815798ef2f5","observation_id":"4a5c7fd5-2379-47ed-88f1-6689d7d21826","resolution":{"observed_at":"2026-08-03T12:50:54.037292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:54.216597Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.216597Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:143bbba844075a8f28ec8e64e430f7f5cfb1d2d32e70a7cbe789616628bad1fc","observation_id":"2b5f4c58-82ad-4dea-9cc9-3617af406298","resolution":{"observed_at":"2026-08-03T12:50:54.216597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:54.392222Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.392222Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:85e8d86e5d28e1860b83f40703c3965c2d5a68d8bed41a6fdf843879d1beabd5","observation_id":"049ba0cd-01d4-4de6-b8a3-519422e20eef","resolution":{"observed_at":"2026-08-03T12:50:54.392222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-03T12:50:54.574003Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.574003Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:880c70fc7f4887608c1453443073885152e384e5542e7e1ad20df2838c222b98","observation_id":"c6fcb0a9-c4d1-48ed-bcad-b5bf9ddf713a","resolution":{"observed_at":"2026-08-03T12:50:54.574003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:54.757188Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.757188Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:1c7cb29fa41d9e9cccdf222f496f37dbb5a6a298127746cce4569e66aec17619","observation_id":"f58eeead-933a-467a-a851-21b5ab4863a4","resolution":{"observed_at":"2026-08-03T12:50:54.757188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:54.920682Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:54.920682Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:e228558c70dd8afa0fc55edf7bbf8ee4ad03bdcd331d37f77242d9fd2c2c0196","observation_id":"ea48f0b4-a5a8-405b-a37d-88c53215d052","resolution":{"observed_at":"2026-08-03T12:50:54.920682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.020234Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.020234Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:e2284be839e282f6303b07e4b34149c109db6ce99586df12550a56b2cb63d386","observation_id":"bd5f7bc8-753e-4c7f-b0b8-da131b15b1c5","resolution":{"observed_at":"2026-08-03T12:50:55.020234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.138645Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthe- sis.ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.138645Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:5d9bbc5ca31a206df73772687af6bda6c2afbd0e988e7b94fbeb734fcd643244","observation_id":"443418a0-fbe9-44fd-8f2f-20b6274307ca","resolution":{"observed_at":"2026-08-03T12:50:55.138645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-03T12:50:55.223027Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.223027Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:1cac47b66c9ddc6cbf69de0696efd86b1109c78b4f90970e527b186509897d07","observation_id":"6c59ac19-0be4-41b6-ad32-71e6c549425a","resolution":{"observed_at":"2026-08-03T12:50:55.223027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.317851Z","title":"Scalable high-resolution pixel-space image synthesis with hourglass diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.317851Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:7b68a3a1d924c9ff55aec7f97f1e74a30c8860cf288c9884631d66b4cca67647","observation_id":"d6c4d476-6285-41c8-9919-663599385812","resolution":{"observed_at":"2026-08-03T12:50:55.317851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.374278Z","title":"Diffusion models beat gans on image synthesis.NeurIPS, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.374278Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d73a474472e91eb31c2756079c731164a6fc630d18237425b48ce0d6bc155489","observation_id":"7cbecdcc-8003-4765-b216-9e33c35f811a","resolution":{"observed_at":"2026-08-03T12:50:55.374278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.447098Z","title":"Continuous conditional generative adversarial networks: Novel empirical losses and label input mechanisms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.447098Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:2ff73c9731c08ddfeb3464312ee6b382877dbaaa0980df89fde583a2f8063f37","observation_id":"4c8b845a-f9eb-4e54-b3db-f00de600a22c","resolution":{"observed_at":"2026-08-03T12:50:55.447098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T12:50:55.554396Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.554396Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:6e93adae4c917544c2221c86a719e4f7c4b04a7eec765017fe281d2f006e6e87","observation_id":"46f66984-eb56-49b7-b93d-411f4a204ecd","resolution":{"observed_at":"2026-08-03T12:50:55.554396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.673625Z","title":"Scaling rectified flow transformers for high-resolution image synthesis.ICML, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.673625Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:7b33374f743aa3bb9ee2d935ccc81d84f26f202cb581cb3e5b362020fd5e029c","observation_id":"d8dae33c-bd9c-4d4e-a2da-8f0a9e1d6fd3","resolution":{"observed_at":"2026-08-03T12:50:55.673625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-03T12:50:55.743597Z","title":"Flux-reason-6m & prism-bench: A million- scale text-to-image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.743597Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:8311a1ed39a9cbc1612168a83f5a930eee0a97a3fe2412478bb970c352017ccd","observation_id":"fce86933-3f87-4417-89e9-eac9301d2ba8","resolution":{"observed_at":"2026-08-03T12:50:55.743597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.748553Z","title":"Masked diffusion transformer is a strong image synthe- sizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.748553Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:ad146140db3192aa07880d2b8153721ead09393a9fe5e2adb5ef6ea426bee980","observation_id":"50a226c8-1f9d-4578-81b7-b4ba3c90a39a","resolution":{"observed_at":"2026-08-03T12:50:55.748553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.876790Z","title":"Geneval: An object-focused framework for evaluating text-to- image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.876790Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:dea5cee8c3170cd0eb29cb5f533d8432fa30ef47cea4a5eb68e49d7d7298b12a","observation_id":"169f42ce-8133-47c0-8fe9-656ad609156a","resolution":{"observed_at":"2026-08-03T12:50:55.876790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:55.975131Z","title":"Gemini 2.0 flash: Model card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:55.975131Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:f1167b4d083741af6ea6e91b83d754cd6b7237400d89a9c625b74e9a8e7977cb","observation_id":"01e3632d-1a80-4299-86c7-bc7de57bf49a","resolution":{"observed_at":"2026-08-03T12:50:55.975131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.074724Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.074724Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d294c2f0514789f4fd91cfbbd37403832bc5e0fa677ab8b7a8e94c921dc5665b","observation_id":"dc04419d-c0f5-46d3-ad1d-975b04c97304","resolution":{"observed_at":"2026-08-03T12:50:56.074724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.184774Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.184774Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:67de124831c1cdd4e1b42c038df1ba6f061b37ae926db58e833cc89beeb77166","observation_id":"e231af7a-6000-49fd-bb17-b2c7020b3b08","resolution":{"observed_at":"2026-08-03T12:50:56.184774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.258054Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.258054Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:0802a1632473b39e389c2846a443a545099a367b4011dd9ea1998d5267dfe441","observation_id":"4c141e81-a4ec-43f2-a1e3-463494a392ea","resolution":{"observed_at":"2026-08-03T12:50:56.258054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.354933Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.354933Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:efacd0e967c19c78d14bec539b8417b3fd449157264a8d797c9660acb52ef10b","observation_id":"a38c9c9e-db43-492a-97cf-c6f5a6643808","resolution":{"observed_at":"2026-08-03T12:50:56.354933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.421838Z","title":"Video diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.421838Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:e179f81866f64839614890a48d77edad98772e072ee346bb6a239055edd21b25","observation_id":"188ce7fe-2ab3-4638-8762-97e5488d6dd2","resolution":{"observed_at":"2026-08-03T12:50:56.421838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.495807Z","title":"Improving sample quality of diffusion models us- ing self-attention guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.495807Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:176cbe633045538b4c0d4d0f99e371a23dff3e5effc28f4791dd525ef1598a66","observation_id":"65dbdf2a-560b-454f-ae22-ae64f98e5f6a","resolution":{"observed_at":"2026-08-03T12:50:56.495807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.566124Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.566124Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:a4c116932e1f5eb86b44ebd68dedcf04fb21a8537797f33f6cde81e3cd2cf16b","observation_id":"a87b0997-d202-49a6-89de-9d26bc3c3577","resolution":{"observed_at":"2026-08-03T12:50:56.566124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T12:50:56.632093Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.632093Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:a7f4ca4bd61728390b5b924ef7f53e1c4bd8d7be6cffd81c2d216cc2c80dee75","observation_id":"2c58c9d2-9d30-4faa-ac41-7a79a0113e02","resolution":{"observed_at":"2026-08-03T12:50:56.632093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.710388Z","title":"Spatiotemporal skip guidance for enhanced video diffusion sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.710388Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:ea5aed78fa1e9c8eb739242ff866e12253c812a184327a40397774abfb220e94","observation_id":"c39c08f7-67aa-46b1-b0e8-fee161902efc","resolution":{"observed_at":"2026-08-03T12:50:56.710388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10257","last_updated":"2025-08-29T13:10:29Z","snapshot_observed_at":"2026-07-06T19:51:01.075884Z","submitted_at":"2024-11-15T15:04:04Z","title":"Guiding a diffusion model using sliding windows","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10257","snapshot_observed_at":"2026-08-03T12:50:56.774068Z","title":"The unreasonable effectiveness of guidance for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.774068Z"},"links":{"cited_paper":"/paper/2411.10257","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:07b7fbf984c8b5ab9d8284391a9b4cadb085d60980ce57620122e23be76598b7","observation_id":"cdcb1845-0e54-4d12-9c09-3186912caf41","resolution":{"observed_at":"2026-08-03T12:50:56.774068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.872247Z","title":"Guiding a diffusion model with a bad version of itself.Advances in Neural Infor- mation Processing Systems, 37:52996–53021, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.872247Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4768ecf03a525e1074a25e396236026e467f0a56298048f4d9d4a5a8afd6c0d8","observation_id":"e9901c2e-4873-427d-9475-77410a788608","resolution":{"observed_at":"2026-08-03T12:50:56.872247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.928511Z","title":"Kolors: Effective training of diffusion model for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.928511Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:8d202f81026cff15c0b062c30c7454e15ac441c037bbe7c4377a7a6cd4b6b42a","observation_id":"a0511644-2bd0-4248-9b3f-deae547bff2d","resolution":{"observed_at":"2026-08-03T12:50:56.928511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:56.977383Z","title":"Tread: Token routing for efficient architecture-agnostic diffusion training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:56.977383Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:f7731de582c6b1dcd66f307bcb898544588a5187583a71dee6319adfeac211df","observation_id":"0900b85f-f2da-42f5-a0e9-2e5966813a5e","resolution":{"observed_at":"2026-08-03T12:50:56.977383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.035852Z","title":"Improved precision and recall metric for assessing generative models.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.035852Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:66449872e9648f77ef6bb91eb8b8b4a23cd72710cf4256b65fd29051f5b07a09","observation_id":"212cc438-bb3a-45fb-90b4-274f23545395","resolution":{"observed_at":"2026-08-03T12:50:57.035852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.085780Z","title":"Applying guidance in a limited interval improves sample and distribution quality in diffusion models.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.085780Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:eb4a076b8ccbaf6f8aae0b57d236bf3b0065945489db5fdffbe717bf8e2b4ed6","observation_id":"c7dce278-fd9c-470e-9429-aa5336d45d56","resolution":{"observed_at":"2026-08-03T12:50:57.085780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.141020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.141020Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:8c9f12747fdc922f1e6740cac96926969226d0202730d9600e8689f9bb57af7b","observation_id":"bd1e5c83-c009-4bd4-b84b-f3d048201024","resolution":{"observed_at":"2026-08-03T12:50:57.141020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-03T12:50:57.221948Z","title":"Playground v2.5: Three insights to- wards enhancing aesthetic quality in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.221948Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:499d9ed78a84d9acc2920fa251c700a31dc5994ed61ae4cad6d6eb09d6b89803","observation_id":"185b8f5c-3286-4478-85a9-fb90ae98e044","resolution":{"observed_at":"2026-08-03T12:50:57.221948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T12:50:57.283172Z","title":"Hunyuan-dit: A powerful multi-resolution dif- fusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.283172Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d1960a3ee424ec04931d2731ab482dc91af36dee862f5627ccab108d22694fc3","observation_id":"86bdbf9d-1baa-4439-b1af-bf37f8db312f","resolution":{"observed_at":"2026-08-03T12:50:57.283172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.333053Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.333053Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:22421947daf51d9bdd0e674cdeeadffea5f5cfd4057e77c25916197ada282c24","observation_id":"66a3ad13-7ead-48d7-ad77-1f9be4330edc","resolution":{"observed_at":"2026-08-03T12:50:57.333053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.391320Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.391320Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:96e141ac0850dcf7a0335301994ead9e0d9215e9a9512d3da9cbefbf84888f18","observation_id":"2d2cdbe5-c2b6-48c3-9e84-5edbb75081c7","resolution":{"observed_at":"2026-08-03T12:50:57.391320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.439352Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.439352Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:c4b72235c5a7072b429605e37c5d555a68502781b7da8a94034c0cd4b2652773","observation_id":"7cc7aabc-b29b-4c7b-97d9-7f7668d56a10","resolution":{"observed_at":"2026-08-03T12:50:57.439352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.453091Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.453091Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:eb17045e4d0fea8cd0be435003002b56519b1304fc74b8c8c82d7826453b981c","observation_id":"95101738-de23-49cd-9c35-6f90b5295ad3","resolution":{"observed_at":"2026-08-03T12:50:57.453091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11831","last_updated":"2024-12-05T04:06:09Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:43Z","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11831","snapshot_observed_at":"2026-08-03T12:50:57.455436Z","title":"Exploring the role of large language models in prompt encoding for diffusion models.arXiv preprint arXiv:2406.11831, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.455436Z"},"links":{"cited_paper":"/paper/2406.11831","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:036b807b521a352e963daa0d2e8edffb091dc32244683bf2def4d925f84bcd3e","observation_id":"1b755507-1910-42ba-82c9-34d53f20576c","resolution":{"observed_at":"2026-08-03T12:50:57.455436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.520767Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable in- terpolant transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.520767Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:fb8a2e1aba0a1132f41c54c2b55f06fc6d1b4c7b7dbc556603681fa9482e3f06","observation_id":"cf92d963-15db-492e-9bd6-02f6af2aecc3","resolution":{"observed_at":"2026-08-03T12:50:57.520767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.620121Z","title":"Albergo, Nicholas M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.620121Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:922027e4c4ea08ec96912c4abe1dab1231f6fabf5b993d66ef3335bd44f89c5e","observation_id":"2cb79127-8bac-4cf0-8a72-c843a532a34e","resolution":{"observed_at":"2026-08-03T12:50:57.620121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.766180Z","title":"Deepcache: Accelerating diffusion models for free, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.766180Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:3f6ba52fe5a8c270c03ea4e19f0befbae480bbd26f2cccd61c721ac4ec74c7e2","observation_id":"1e8af4b8-890f-4f4e-9bb9-81712b71d5f4","resolution":{"observed_at":"2026-08-03T12:50:57.766180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.872692Z","title":"Learning-to-cache: Accelerating diffusion transformer via layer caching, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.872692Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:b422f58c82724b2a72213549a65d2a0b165d85dd3e622df11c374e6d56279759","observation_id":"69fe9527-5063-4a28-9030-b76afc498c14","resolution":{"observed_at":"2026-08-03T12:50:57.872692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:57.951063Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.951063Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:818abd2976e0b273f46007534fdaedcbaa0579a70009409f52cb046d4a47a6e5","observation_id":"e51a40a6-f485-4401-ae0e-7b7e279713cf","resolution":{"observed_at":"2026-08-03T12:50:57.951063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.008890Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.008890Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:ea5d98ddf6f0a37b1920a3b9075c5b22c45da86a15742f515dbda81ad654d19a","observation_id":"0a878edf-caba-4d46-b7d7-314f47291d59","resolution":{"observed_at":"2026-08-03T12:50:58.008890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08384","last_updated":"2024-10-30T14:33:27Z","snapshot_observed_at":"2026-07-06T18:29:44.841845Z","submitted_at":"2024-06-12T16:34:26Z","title":"Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08384","snapshot_observed_at":"2026-08-03T12:50:58.093035Z","title":"Diff-a-riff: Musical accompani- ment co-creation via latent diffusion models.arXiv preprint arXiv:2406.08384, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.093035Z"},"links":{"cited_paper":"/paper/2406.08384","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:fc39ab4cf72253d63478a60df3479d242387cbe901f8929574e093f577ac3da3","observation_id":"6e340c0b-caab-45aa-834e-92ea2f7323e2","resolution":{"observed_at":"2026-08-03T12:50:58.093035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.198676Z","title":"Journeydb: A benchmark for generative image understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.198676Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4c3c751015bb5502ae398f1f662e213ec72a3e54a3dba4d7fc743d98a477d6b7","observation_id":"c4b445e2-cee6-4c1c-b76e-811f281a2a75","resolution":{"observed_at":"2026-08-03T12:50:58.198676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.357751Z","title":"Scalable diffusion models with transformers.ICCV, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.357751Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:6e6851557e117a73b475e98e58151d2d64b9d54a66bf91226321fd56ae248b7a","observation_id":"30126d74-8800-4f75-810c-feb6e5bf5453","resolution":{"observed_at":"2026-08-03T12:50:58.357751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.390108Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.390108Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:ae1d6412eef1046104828665a5fb50ff38f7c5a426b83eaa87de9cb8db8b79b0","observation_id":"04a02a2f-6c75-48d6-8a84-f8430764e5f4","resolution":{"observed_at":"2026-08-03T12:50:58.390108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-03T12:50:58.457996Z","title":"Hierarchical text-conditional image genera- tion with clip latents.arXiv preprint arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.457996Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:85e98ec03aa2081f002a2febebf06eff76582da04a49f34e0ad24d8c23229c59","observation_id":"f90dea6d-d71e-4319-9158-58f1bc7abaf4","resolution":{"observed_at":"2026-08-03T12:50:58.457996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-03T12:50:58.556668Z","title":"Mixture-of- depths: Dynamically allocating compute in transformer-based language models.arXiv preprint arXiv:2404.02258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.556668Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:8d26a32990a31455a22a1d6ae7b10fcb4bbf3ad7832538d43de3cf771dc306d5","observation_id":"029f37e1-621a-43b7-a5e2-8493cbcb0b8f","resolution":{"observed_at":"2026-08-03T12:50:58.556668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.655404Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.655404Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:0fbb44e8ad3a8364f692445a05b5fe13719de4f91555b10a6705e594f0b463a3","observation_id":"e68546b3-4391-4a03-aa60-b2603449263a","resolution":{"observed_at":"2026-08-03T12:50:58.655404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.749929Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.749929Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:07eaea4e4159085b60207dd4bb318e9eaaa446a8cd4df45207aaf484d05dc053","observation_id":"60519fb4-ed2e-40da-a307-a26117ddd552","resolution":{"observed_at":"2026-08-03T12:50:58.749929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02687","last_updated":"2025-06-03T10:51:23Z","snapshot_observed_at":"2026-08-05T21:17:54.888017Z","submitted_at":"2024-07-02T22:04:00Z","title":"No Training, No Problem: Rethinking Classifier-Free Guidance for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02687","snapshot_observed_at":"2026-08-03T12:50:58.833448Z","title":"No training, no problem: Rethinking classifier-free guidance for diffusion models.arXiv preprint arXiv:2407.02687, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.833448Z"},"links":{"cited_paper":"/paper/2407.02687","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d155fa9b866139c7b95e4ddcf3ecd1532a70ab12f1861ae0a998e94dd434c66d","observation_id":"a7ae1302-987d-4b8e-a3ad-955a0aa14b48","resolution":{"observed_at":"2026-08-03T12:50:58.833448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.890950Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.890950Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:37dad11f376ae4ad19aa1077b4d8d5d7e8d349bc5c65b6955a1e84bbee67d648","observation_id":"eb6e24af-85f6-4337-ab36-b7910234f940","resolution":{"observed_at":"2026-08-03T12:50:58.890950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:58.968846Z","title":"Baumann, Vincent Tao Hu, and Björn Ommer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:58.968846Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:15cab731d4825d8fb7e4bec96a796e76212a36322c98dc1b09cc069800db35b7","observation_id":"a9885157-15b2-4466-bc64-662316392571","resolution":{"observed_at":"2026-08-03T12:50:58.968846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15811","last_updated":"2024-07-22T17:23:28Z","snapshot_observed_at":"2026-08-07T13:24:09.828113Z","submitted_at":"2024-07-22T17:23:28Z","title":"Stretching Each Dollar: Diffusion Training from Scratch on a Micro-Budget","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15811","snapshot_observed_at":"2026-08-03T12:50:59.050999Z","title":"Stretching each dollar: Diffu- sion training from scratch on a micro-budget.arXiv preprint arXiv:2407.15811, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.050999Z"},"links":{"cited_paper":"/paper/2407.15811","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:262dc478f3695498871602c95698ce8ac1653b889f410545ef535bf629e46fe1","observation_id":"1d40ae68-99c5-446e-9f29-4215fa0d2b9a","resolution":{"observed_at":"2026-08-03T12:50:59.050999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-03T12:50:59.131746Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.131746Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:0189d9c0da53dfb8ca26fe2aa0b8067f950100dbbb26a861bb3198eb5d654555","observation_id":"4acdd0f8-ce85-4d3c-81f2-75ca7e2f358a","resolution":{"observed_at":"2026-08-03T12:50:59.131746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.218742Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.218742Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4fbfa012f837609a12b1795b8605fd93a9f142d2f871e89156e240c121e37d91","observation_id":"4a29f6aa-2e71-42bf-bf62-891034ce41de","resolution":{"observed_at":"2026-08-03T12:50:59.218742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.301236Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.301236Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:85749424266f83efdf6b4967744c4a5ec8106ecdaf278f64d329f4e17eb68128","observation_id":"135fc1b3-a59b-4e29-82d6-6ae5e659bb76","resolution":{"observed_at":"2026-08-03T12:50:59.301236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.359556Z","title":"Improved techniques for training score-based generative models.Advances in neural information processing systems, 33:12438–12448, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.359556Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:5c869d93c3500eb6e2cec2f0ecdd32ffa3c34842086f117fd9c74704bc34a5a4","observation_id":"f9cf1cdf-ecf5-453b-bc67-5e16cbacebc7","resolution":{"observed_at":"2026-08-03T12:50:59.359556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-03T12:50:59.406567Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.406567Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d013253e3a2460fafa99f31b6daa935cf52a04bf46c384896627e98956e8739f","observation_id":"c4d8e369-b26f-442a-9eaa-847434821008","resolution":{"observed_at":"2026-08-03T12:50:59.406567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.492606Z","title":"Stable diffusion 2.0 release","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.492606Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:90c834279a52c513669efaa4daab98c4e7ac3b47021f3e2964d3d388a3a97bff","observation_id":"745bb5ec-d2ce-4dbc-aaa0-c6eb5eac8ab7","resolution":{"observed_at":"2026-08-03T12:50:59.492606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.574887Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.574887Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4c5cfc46f64d9fef8f2f224ace8149c66b75a572e4fcd5e551662a585c5dc343","observation_id":"2701bbcd-1ea4-42f0-8df2-5200b33867ab","resolution":{"observed_at":"2026-08-03T12:50:59.574887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T12:50:59.627937Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.627937Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:404fb162a1f0f4bb86d2af5c6dd7d83d804bc67688619419147649e27ec21948","observation_id":"6e7a2e58-11cf-4667-9f8b-64fef7fc6afe","resolution":{"observed_at":"2026-08-03T12:50:59.627937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.701981Z","title":"Attention is all you need.NeurIPS, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.701981Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:c29f07a9ce2bac77aab1f4dff021923cb50b8ca8346ed71ff8d360f7b9048aee","observation_id":"f716218d-6b2e-4609-baa1-47d05cba67bc","resolution":{"observed_at":"2026-08-03T12:50:59.701981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.710447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.710447Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:0ff2e80d8af1b0c2f95919802ea37eb2382ace01586d80f30d2e80e82b70cae0","observation_id":"e4569b63-fa06-452c-aca6-301572753442","resolution":{"observed_at":"2026-08-03T12:50:59.710447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:50:59.811556Z","title":"Fasterdit: Towards faster diffusion transformers training with- out architecture modification.Advances in Neural Informa- tion Processing Systems, 37:56166–56189, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.811556Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:f865f04962767008617047985b8b82606975fbe542f5ea16391fecbaa014db76","observation_id":"d56a6924-e998-4f5f-8f0c-2b0a60be51e1","resolution":{"observed_at":"2026-08-03T12:50:59.811556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-03T12:50:59.903161Z","title":"Representa- tion alignment for generation: Training diffusion transformers is easier than you think.arXiv preprint arXiv:2410.06940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:59.903161Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:2322370ae948c3b1be155c13436e5dcfb1a846e24a812df63f012c18dcc3ee42","observation_id":"5f5a8ac2-4e93-4a7a-842a-9624ae44a9df","resolution":{"observed_at":"2026-08-03T12:50:59.903161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:51:00.008235Z","title":"Root mean square layer normalization.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:00.008235Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:c3f124cda3b4fb4c729659098817d678f058d161ceb60643256a6a8670144c38","observation_id":"9721dc86-779f-4a60-8c7c-58ed31f3b733","resolution":{"observed_at":"2026-08-03T12:51:00.008235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:51:00.102027Z","title":"Fast training of diffusion models with masked trans- formers.TMLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:00.102027Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:269245c7e61ad3af847005723163ad9cdbaae57e1fa45f38410c980755a4bd0e","observation_id":"bea11ed3-68a8-43b7-9e18-bdb1f629ff7f","resolution":{"observed_at":"2026-08-03T12:51:00.102027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:51:00.184724Z","title":"Cogview4-6b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:00.184724Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:1a8fb44cff4b54e4328353917311c1f2e9b7906961532e5a3203118420003601","observation_id":"143b0f31-f940-4363-b47d-0e87299dd7b6","resolution":{"observed_at":"2026-08-03T12:51:00.184724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T12:51:00.241592Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:00.241592Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4580ab865fa48a8c007e74d906ec798134de7312d76203a6fd5bcd1e17c21913","observation_id":"331d6003-3d86-4417-8680-9bf34a9e1467","resolution":{"observed_at":"2026-08-03T12:51:00.241592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:51:00.344231Z","title":"Describe the image by detailing the color, shape, size, texture, quantity, text, and spatial relationships of the objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:00.344231Z"},"links":{"citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:4be7064133616e02058dbe889da7b101e8d1b6c755b08f15e6be71e92507f388","observation_id":"40463b5a-27ea-4433-8445-1d8f2cc8b4e3","resolution":{"observed_at":"2026-08-03T12:51:00.344231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:17:46.914287Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2601.01608."}