{"as_of":"2026-08-22T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db87426b843435deaee6924c6fc4f19e965889f75672f4a00f0ad1ac6bf67ced","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:04:34.690217Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.07773/citation-record","integrity":"/paper/2601.07773/integrity","json":"/paper/2601.07773/citation-record.json","paper":"/paper/2601.07773"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.240145Z","title":"Williams","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.240145Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:23ba8aa8a8d2564cf534a056d8f6356a4351c1ac8c4618fc69d2bcaa9f7b6fbf","observation_id":"343b4b19-e6da-41a7-98d4-5506c2b1576d","resolution":{"observed_at":"2026-08-03T11:04:30.240145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.394875Z","title":"Dense2moe: Unifying pruning and upcycling for efficient large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.394875Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:63365bf918984e9539bf11935824db0a1400d818b512df5680b9805fd5d917ea","observation_id":"d08903d3-d0c5-4aaa-831f-33cdb500fe37","resolution":{"observed_at":"2026-08-03T11:04:30.394875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.536746Z","title":"All are worth words: a vit backbone for score-based diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.536746Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:a707a69ded11244378d443b925498e11a86b9da0afdf8420d8cd1e56597b9311","observation_id":"84134ba0-2233-4c82-8226-426cfc775da0","resolution":{"observed_at":"2026-08-03T11:04:30.536746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.660866Z","title":"Masked autoencoders are effective tokenizers for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.660866Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:0901266b680ba745d030a5dc23fc0ae8d51afe0a07a53d5ad1f51dce14f3eb85","observation_id":"5b6b7c9e-70b0-4338-9dee-eeef039adf4e","resolution":{"observed_at":"2026-08-03T11:04:30.660866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.771861Z","title":"On the efficacy of knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.771861Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:1ef7e7ee6d0c5e6d435a9000140448e41589ca98aa40344f950d001643d83a00","observation_id":"7957a1b0-8c72-4ad0-9572-778e01470756","resolution":{"observed_at":"2026-08-03T11:04:30.771861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.887732Z","title":"Text-to-image diffusion models are zero shot classifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.887732Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:03b1c3e166b27e2c5b49a1a6eeb3050b147a3c7025fbfe2038351b618e7b898c","observation_id":"2ca103f6-01a5-4dd7-a1e6-76f08aef37e5","resolution":{"observed_at":"2026-08-03T11:04:30.887732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.015506Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.015506Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:7c1a0266e8f0e31c2cd81c884acb354a78ea63e3f72a1c61ace0b7b96db1b3df","observation_id":"b0eacc39-5f6f-46e9-be9c-c452a7e29161","resolution":{"observed_at":"2026-08-03T11:04:31.015506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T11:04:31.101092Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.101092Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:1b09502ddfd87f53ee521ae821bfb96e1b135a1a41e3a32671a2d86dc3d7da29","observation_id":"24619b77-6750-4c4f-a9bf-90b2426f67c4","resolution":{"observed_at":"2026-08-03T11:04:31.101092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.215091Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.215091Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:9924cbf2b64a618640a801cbe91d6c423527816fa20be70173b7a41870058591","observation_id":"77605ae6-7bf5-464c-8608-cf77d41d35e7","resolution":{"observed_at":"2026-08-03T11:04:31.215091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.328641Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.328641Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:cb464f155d5b7d328ce113691a7a7673425fbb35709558b9f1fc878d136875bc","observation_id":"5e4af555-dc0a-47aa-a428-4482e6cfca24","resolution":{"observed_at":"2026-08-03T11:04:31.328641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.438323Z","title":"Masked diffusion transformer is a strong image synthesizer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.438323Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:ff2ae0fe53ab17fa0103b176d33728a76af5c9900db4162dd638ec7ce92512ab","observation_id":"66480d2f-6d0f-4133-aeaa-7d1bde03df61","resolution":{"observed_at":"2026-08-03T11:04:31.438323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-08-18T21:22:33.938641Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-03T11:04:31.510886Z","title":"Mdtv2: Masked diffusion transformer is a strong image synthesizer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.510886Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:5c677cba2f13bf2ed5f94784036ccfda266f48c52a27538b9239e7077dc00b7f","observation_id":"c079214e-807c-49f7-9c58-21387021e06b","resolution":{"observed_at":"2026-08-03T11:04:31.510886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.582552Z","title":"Layersync: Self-aligning intermediate layers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.582552Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:7e96b13c88d981b3c34b5871ae514e8654632d5e9f679eb7e623e923073b7992","observation_id":"d3f4451b-3698-4ff4-ba48-f6368e6f5091","resolution":{"observed_at":"2026-08-03T11:04:31.582552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.621137Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.621137Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:a46b68035a4a5aecf50b5f99df236d99540332e98a27a52a765864dea8adb3e5","observation_id":"d5b8e145-97f4-46ed-a507-c8507488b573","resolution":{"observed_at":"2026-08-03T11:04:31.621137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T11:04:31.693013Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.693013Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:a1f3db54c3b3e51300672d26f9577c813fccb7a479cd968318796a8ec4d750bb","observation_id":"79aa0ced-103e-462a-9dc6-2b5df3a85b78","resolution":{"observed_at":"2026-08-03T11:04:31.693013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.736661Z","title":"No other representation component is needed: Diffusion transformers can provide representation guidance by themselves.arXiv preprint arXiv:2505.02831, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.736661Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:488f88a328e24e9f36365447ebf93762cceba4e23eaf9bab723f218475b457e6","observation_id":"46f45b62-c423-47d6-9bc7-5dc7d579d4b0","resolution":{"observed_at":"2026-08-03T11:04:31.736661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.806757Z","title":"Tread: Token routing for efficient architecture-agnostic diffusion training.arXiv preprint arXiv:2501.04765, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.806757Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:937989fc097d7929d4c94a7cdcf693201984583302a27417e3f2b6a35293eaea","observation_id":"2b969fdc-91cd-4342-8b59-53bca76c8b95","resolution":{"observed_at":"2026-08-03T11:04:31.806757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.844313Z","title":"Improved precision and recall metric for assessing generative models.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.844313Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:f9056707129499d600aa10a2a8d78e09aaf037cf11ddb288f2abeec9268983a6","observation_id":"883a005f-8780-49b6-9744-873c41d45b69","resolution":{"observed_at":"2026-08-03T11:04:31.844313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.916189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.916189Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:2b63d423b4f7c3e442b84af77d21adddc4af421d0328557e6f467e9fdc4de173","observation_id":"c9c727cf-209f-46a7-b7f1-e788693a94f0","resolution":{"observed_at":"2026-08-03T11:04:31.916189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:31.955093Z","title":"Exploiting diffusion prior for generalizable dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:31.955093Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:5604e554b565e6d3ae0e131c171963585f4bd58c36a3fce75ce690686779f2ab","observation_id":"67ab059a-0f05-4152-aa6d-4108d9901e4f","resolution":{"observed_at":"2026-08-03T11:04:31.955093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.026466Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.026466Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:dbe1e1e245b4d09dd6929848b8600e29c3368c2ba0faa8b89f39d47b76a95939","observation_id":"b8fb6cca-c866-4263-bb2d-6f0e865bc5cc","resolution":{"observed_at":"2026-08-03T11:04:32.026466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.068939Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.068939Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:1373da4df392986a2635926eea927c6ff828fd3e41fcd7a2b209a829093038d9","observation_id":"71258a92-ed8d-425d-8faa-f88161f044d7","resolution":{"observed_at":"2026-08-03T11:04:32.068939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.141637Z","title":"LLaVA-onevision: Easy visual task transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.141637Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:e5f4bd5123ba117f9324cd1af05047f87e68f4dc311bb6048cb1d127d8f9a673","observation_id":"36fc854a-7d2a-4a98-b978-8277f6f9d1f2","resolution":{"observed_at":"2026-08-03T11:04:32.141637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.216213Z","title":"Return of unconditional generation: A self-supervised representation generation method.Advances in Neural Information Processing Systems, 37:125441–125468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.216213Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:fc6b820cb6b73623503ebbd0f06e8048e032bde9193290c2b38f3a8ab6d68712","observation_id":"b0788514-09a4-443a-83a8-5e8816a8b837","resolution":{"observed_at":"2026-08-03T11:04:32.216213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-03T11:04:32.252418Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.252418Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:9571eecf23d6d7fd088704f895b682ceec625f4ec98c06701aaa058ccbbca687","observation_id":"98638ac3-139f-431d-9cf9-f47b4921b9ca","resolution":{"observed_at":"2026-08-03T11:04:32.252418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-18T20:56:40.841401Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-03T11:04:32.319958Z","title":"Albergo, Nicholas M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.319958Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:ef39c4e48e08142ed874c2a87aba674d986348bb5a251db720c922e3cf4ce40f","observation_id":"26443260-9a7e-468a-b8c5-2868fd8a3965","resolution":{"observed_at":"2026-08-03T11:04:32.319958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.360992Z","title":"Not all diffusion model activations have been evaluated as discriminative features.Advances in Neural Information Processing Systems, 37:55141–55177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.360992Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:419bf544e17ce40368e9708d4b07008755e2cc15450c57f974dedf16c401df82","observation_id":"c7de6c79-674d-4b56-9abc-d5238358169c","resolution":{"observed_at":"2026-08-03T11:04:32.360992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.402197Z","title":"Improved knowledge distillation via teacher assistant","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.402197Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:6251d6a4b60dccc01bac8a2e6a981942f4cf2d861e5e1c7f8fcf18480e3fc12a","observation_id":"bb8e7b27-f659-4b2e-bc5c-3a748d72a65f","resolution":{"observed_at":"2026-08-03T11:04:32.402197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03841","last_updated":"2021-03-05T17:56:03Z","snapshot_observed_at":"2026-08-16T18:40:55.739699Z","submitted_at":"2021-03-05T17:56:03Z","title":"Generating Images with Sparse Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03841","snapshot_observed_at":"2026-08-03T11:04:32.426917Z","title":"Generating images with sparse representa- tions.arXiv preprint arXiv:2103.03841, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.426917Z"},"links":{"cited_paper":"/paper/2103.03841","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:3d185d01d66f15dc0a3fb9742dae17f2be8d112099f472bdfb24567cf44812dc","observation_id":"6f9f2409-fc7d-49a6-869d-4cc32f5d620a","resolution":{"observed_at":"2026-08-03T11:04:32.426917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.468687Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.468687Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:4dfd16f38797d4776616e19c068d1ab108aaa8ebb498fd00681c349eb666ae18","observation_id":"d10b8d49-8c48-4ec2-85b6-0766b85b2b24","resolution":{"observed_at":"2026-08-03T11:04:32.468687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.491916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.491916Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:683af41133933f65b2231335165502e1c79a6cbbdca0410f45d250f4bf7da49a","observation_id":"b50fd8cd-81a0-48b9-a843-352e234df121","resolution":{"observed_at":"2026-08-03T11:04:32.491916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-08-17T19:22:44.145403Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-03T11:04:32.558753Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.558753Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:65047f8dda7ba83bc8f88d419e81ee707e78ba91eab2f2adf8faf71fce5e2eb8","observation_id":"06d2bb0d-5e77-4ea3-bbb4-b09d0767775d","resolution":{"observed_at":"2026-08-03T11:04:32.558753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T11:04:32.601831Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.601831Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:a4cfe796c4f50016d5be5dc9f654fb92372e2180d94182a399e6fe046ed917c0","observation_id":"bf21e4af-676c-4e97-ba4a-99214d624721","resolution":{"observed_at":"2026-08-03T11:04:32.601831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.641644Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.641644Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:5f2e477c329e948603437e063c777ba976e50fe677e01ac25b9faa7290edbcdc","observation_id":"b73d1f4d-d468-48e5-b133-c26b7bb387b3","resolution":{"observed_at":"2026-08-03T11:04:32.641644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.678528Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.678528Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:4173718372ef818e8e2a982e0e70c9312b6f46eea08e5175694d06501c21ddaa","observation_id":"3f9a9de5-33c1-4902-88f6-4c60f71f4415","resolution":{"observed_at":"2026-08-03T11:04:32.678528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-03T11:04:32.741807Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.741807Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:5c9a3dd66b92508f3b5bf19aac76802d62fd86661f315ac9ad9b27e571b3fbde","observation_id":"b1e9d441-8cd2-4be2-bb9a-25398889c7d3","resolution":{"observed_at":"2026-08-03T11:04:32.741807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.779228Z","title":"What matters for representation alignment: Global information or spatial structure?arXiv preprint arXiv:2512.10794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.779228Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:49c847a65dabe4eaad36c6a3bac9be51de2444611cee3f1692a16069628c7c76","observation_id":"9975f2cf-b7a0-4576-a9e6-7b5c6e5d9a8b","resolution":{"observed_at":"2026-08-03T11:04:32.779228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.846691Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.846691Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:99f15481e2c1ff58ed8477aa906df3e82e40ba090af1bbcbd71f3ecb24d4b206","observation_id":"2e286c2a-6197-443f-b1e3-c773ef434f51","resolution":{"observed_at":"2026-08-03T11:04:32.846691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.883671Z","title":"U-dits: Downsample tokens in u-shaped diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.883671Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:1ac10920e9e772b40779e1ca2341610b95d5e9a81d28f06db87ffe5473440f62","observation_id":"fee09b17-9801-4e12-930c-637869f3931e","resolution":{"observed_at":"2026-08-03T11:04:32.883671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:32.952043Z","title":"U-repa: Aligning diffusion u-nets to vits, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:32.952043Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:32197c8e11cfdb327b0fa2f06f5dbbf49b4df63c5986d647255619e7a7e73aa3","observation_id":"6a1b40e6-dc1c-40d3-9a96-1baf41bf9394","resolution":{"observed_at":"2026-08-03T11:04:32.952043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.018805Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.018805Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:ff3b57e44f9f3b441ae180080e9d286e60c6d48f78f219ebd91b06cb78d20c71","observation_id":"fc1ef668-89f6-4b14-ad91-2e22f4a9a80b","resolution":{"observed_at":"2026-08-03T11:04:33.018805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T11:04:33.054433Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.054433Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:12a93d2b834ee90bc77b6e2054c3410e4af601f82501a6dc58f8951a71f9180b","observation_id":"9ad60dd4-e550-4c5e-8246-f7c49c0719f4","resolution":{"observed_at":"2026-08-03T11:04:33.054433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.145552Z","title":"Learning diffusion models with flexible representation guidance.arXiv preprint arXiv:2507.08980, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.145552Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:8b981ed0214de14ee61ab3d6ba254c665d67e7fd649071933785655c5839d3db","observation_id":"11e5daf8-721f-4837-ab86-353f061141be","resolution":{"observed_at":"2026-08-03T11:04:33.145552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09027","last_updated":"2025-07-24T15:55:00Z","snapshot_observed_at":"2026-08-19T17:13:28.622728Z","submitted_at":"2025-06-10T17:53:29Z","title":"Diffuse and Disperse: Image Generation with Representation Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09027","snapshot_observed_at":"2026-08-03T11:04:33.203726Z","title":"Diffuse and disperse: Image generation with representation regularization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.203726Z"},"links":{"cited_paper":"/paper/2506.09027","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:b3bacf0b5fd533b8a0c8e5b0898ad220932020db2caee77e09eb63c388f87cbf","observation_id":"cb89359c-c531-40ab-991b-8c4c9ca33d02","resolution":{"observed_at":"2026-08-03T11:04:33.203726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05741","last_updated":"2025-04-09T04:23:38Z","snapshot_observed_at":"2026-08-20T13:13:18.546061Z","submitted_at":"2025-04-08T07:17:45Z","title":"DDT: Decoupled Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05741","snapshot_observed_at":"2026-08-03T11:04:33.265929Z","title":"Ddt: Decoupled diffusion transformer.arXiv preprint arXiv:2504.05741, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.265929Z"},"links":{"cited_paper":"/paper/2504.05741","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:8fdcc839bd56d9c78af8759104b09a70912372769279beb48677d3ff26e40914","observation_id":"848296e8-9d39-4e26-870f-229af9ce8183","resolution":{"observed_at":"2026-08-03T11:04:33.265929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16792","last_updated":"2025-05-22T15:34:33Z","snapshot_observed_at":"2026-08-19T06:09:52.812606Z","submitted_at":"2025-05-22T15:34:33Z","title":"REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16792","snapshot_observed_at":"2026-08-03T11:04:33.326758Z","title":"Repaworksuntilitdoesn’t: Early-stopped, holisticalignmentsupercharges 19 diffusion training.arXiv preprint arXiv:2505.16792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.326758Z"},"links":{"cited_paper":"/paper/2505.16792","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:6c17a50ea34f43af0bc2a94cca0b88397eb99edc16039bfe2c5244597754ed1e","observation_id":"a8d9182a-c01b-4eed-b82d-4fb6cc27b3bb","resolution":{"observed_at":"2026-08-03T11:04:33.326758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.389566Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.389566Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:6547298a32ba47dd51ee0e3809937cffbd9b04f78290f717132756bf6d4c9ad3","observation_id":"3d9f7505-9aaf-47f3-b85d-0f3656fb2502","resolution":{"observed_at":"2026-08-03T11:04:33.389566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.450406Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.450406Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:806ea34359958a395a70e0d829a4eb3db8069d2d461c2beb8ecf6683c9aa585d","observation_id":"67f0f128-75f7-4828-b261-4266eeef9b3b","resolution":{"observed_at":"2026-08-03T11:04:33.450406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.600816Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.600816Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:8e94b927d40631062e3ea395cc4ca60e7e1d8d1fff5c73e20d7381fb57462642","observation_id":"204dd7a9-3b1b-4f85-ba9a-f450b5314f55","resolution":{"observed_at":"2026-08-03T11:04:33.600816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.689727Z","title":"Reconstruction vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.689727Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:d6c70c9a076db78fa0bec6d604b8905a2e37e17919867cd16ba6946a3fbb73c0","observation_id":"8034b3ff-01e1-4cc7-ae38-d538b04bf897","resolution":{"observed_at":"2026-08-03T11:04:33.689727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.780277Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.780277Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:df04cc6feb3f418af0cbae2e771efa5aa91ce4ec06ce9fb9df6337567526bfa6","observation_id":"c3584869-9d0a-4aa4-a7a3-a88ebb51b2b2","resolution":{"observed_at":"2026-08-03T11:04:33.780277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:33.995245Z","title":"Root Mean Square Layer Normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.995245Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:47dce8600bcc76c7ff904b18fa9b097cad80d881cc5f2b3c4345bd007a8c4bd2","observation_id":"c2b92ab2-d4a2-47ad-81a9-cff4acfd8fda","resolution":{"observed_at":"2026-08-03T11:04:33.995245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-18T22:16:12.132549Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-08-03T11:04:34.145024Z","title":"Dynamic diffusion transformer.arXiv preprint arXiv:2410.03456, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:34.145024Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:6c2a2f7d2b8b08755c4ccce512a8823ee9e1cfb01e25a310b7f5f35cc90ba825","observation_id":"7715acdd-5def-4568-8d74-6327ba191904","resolution":{"observed_at":"2026-08-03T11:04:34.145024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:34.312951Z","title":"Fast training of diffusion models with masked transformers.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:34.312951Z"},"links":{"citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:2f635ab44265aaf5ba0dd450a474e43a84075e6ba100362fd5968488f6938516","observation_id":"ffe299a5-5a94-42a3-874a-b75c6133bd9e","resolution":{"observed_at":"2026-08-03T11:04:34.312951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17004","last_updated":"2024-03-25T17:59:35Z","snapshot_observed_at":"2026-08-17T21:58:24.442620Z","submitted_at":"2024-03-25T17:59:35Z","title":"SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17004","snapshot_observed_at":"2026-08-03T11:04:34.690217Z","title":"Sd-dit: Unleashing the power of self-supervised discrimination in diffusion transformer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:34.690217Z"},"links":{"cited_paper":"/paper/2403.17004","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:facdbffb4a2a3f74465417b2f9f3440a16c6c414c3a2495aca4bc2cee954add3","observation_id":"362d3c2f-29ed-41fd-a434-45728f44969f","resolution":{"observed_at":"2026-08-03T11:04:34.690217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-20T10:31:24.549119Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-03T11:04:33.511837Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:33.511837Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2601.07773"},"observation_digest":"sha256:5f7280b84b42d7249f50719f72e4013ada5abc0e1ee1423462a51f9ab1a38c4e","observation_id":"a02201cd-15ad-4678-a2bb-f077074c6cfa","resolution":{"observed_at":"2026-08-03T11:04:33.511837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.07773","last_updated":"2026-07-10T09:39:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T07:59:23.953709Z","submitted_at":"2026-01-12T17:52:11Z","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2601.07773."}