{"as_of":"2026-08-21T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77c791e43be8d09a1059b4fa0df6b0ce29997cccfc69450bf0f1e8afcd3acb7e","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:30:36.333846Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.19778/citation-record","integrity":"/paper/2511.19778/integrity","json":"/paper/2511.19778/citation-record.json","paper":"/paper/2511.19778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:24.833693Z","title":"Approximate caching for efficiently serving{Text- to-Image}diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:24.833693Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2c773b2fa7fbec43c2f22129632b5eb81746369861ec0dd71d6e3fd9f4f3329f","observation_id":"e0ed16a2-9d31-49cf-b141-03222a006b78","resolution":{"observed_at":"2026-08-03T20:30:24.833693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-03T20:30:25.011626Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.011626Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5524bb6536f5c3125f78e511ca00b08b5b1ba5977876a32fb607c76f8d19dac4","observation_id":"c2c081a3-c18f-4e9e-b510-7261d594a3c4","resolution":{"observed_at":"2026-08-03T20:30:25.011626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-16T13:11:25.569465Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-03T20:30:25.133281Z","title":"Round and round we go! what makes rotary positional encodings use- ful?arXiv preprint arXiv:2410.06205, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.133281Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5c944d2c053fa03cd2e8184c96393b98a6209657dab65c4433f3dd9192563e6b","observation_id":"aa9bb1a7-4d87-4e78-8034-93c7bed08129","resolution":{"observed_at":"2026-08-03T20:30:25.133281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.270630Z","title":"Gpt-neox- 20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.270630Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f7b09430fe320c5d9180256f3f2a016240510dca0798c11570bbaef1d6415781","observation_id":"2efe5917-de46-40db-b023-e781c87f8ed6","resolution":{"observed_at":"2026-08-03T20:30:25.270630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.374663Z","title":"Taehv: Tiny autoencoder for hun- yuan video.https://github.com/madebyollin/ taehv, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.374663Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f37db77de485e62fca7fa2434fd0f9d910bae570898e3700d34a172a9ff4f0e1","observation_id":"38a6f7a2-ce87-4135-a3e1-9e8cedbec33d","resolution":{"observed_at":"2026-08-03T20:30:25.374663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.474450Z","title":"Token merging for fast stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.474450Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:03157d442cdcc7210b4abc627c37365799e95f192603037de292f9bd0329bcb1","observation_id":"84d0ef3f-e380-4dff-907d-7793c0119df1","resolution":{"observed_at":"2026-08-03T20:30:25.474450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.577343Z","title":"Ld-pruner: Efficient pruning of latent diffusion models using task-agnostic insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.577343Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:97668359fc49193946b5b18a1c0cfc42c1e769d74590d369c55a999db4b03cf0","observation_id":"31ce9347-3152-4476-ac1a-c3bc083815f6","resolution":{"observed_at":"2026-08-03T20:30:25.577343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.675140Z","title":"Sparsedit: Token sparsification for efficient diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.675140Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f542711261659bd0b96b3e1af6dec00c01b7e0828d5c42ebe7d22edd38be30f9","observation_id":"ca16a58b-01ce-48d4-86ac-e5d416c99c65","resolution":{"observed_at":"2026-08-03T20:30:25.675140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.756515Z","title":"Pixart-α: Fast train- ing of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.756515Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c09041fa5c300a2303f8286b8c7c3f780d2cc63bbfc51eb7c8f5e2371dc4dc9c","observation_id":"670e1e22-1ba3-45d4-9538-933145eea156","resolution":{"observed_at":"2026-08-03T20:30:25.756515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:25.852747Z","title":"Q-dit: Ac- curate post-training quantization for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.852747Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:790b55635a8fb88053b7542ff55fca464541737f86108e630dc3c92f56015fdd","observation_id":"1e56d59a-441a-46ac-8d52-72f3086b835e","resolution":{"observed_at":"2026-08-03T20:30:25.852747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01125","last_updated":"2024-06-03T09:10:44Z","snapshot_observed_at":"2026-08-16T13:46:50.271264Z","submitted_at":"2024-06-03T09:10:44Z","title":"$\\Delta$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01125","snapshot_observed_at":"2026-08-03T20:30:25.973804Z","title":"A training-free acceleration method tailored for diffusion transformers.arXiv preprint arXiv:2406.01125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:25.973804Z"},"links":{"cited_paper":"/paper/2406.01125","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:65fa11e9e85d8ead72584c0974e97892bc0c1959b0bc825e38e9c0802ff6615e","observation_id":"a6fdde84-867f-4e05-ab22-9d113dcf9426","resolution":{"observed_at":"2026-08-03T20:30:25.973804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-17T07:34:53.340755Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03065","snapshot_observed_at":"2026-08-03T20:30:26.075671Z","title":"Sparse-vdit: Unleashing the power of sparse attention to accelerate video diffusion transformers.arXiv preprint arXiv:2506.03065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.075671Z"},"links":{"cited_paper":"/paper/2506.03065","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:de7cf97b852211e9a057746e77cb22cd40795ce96b91c9602492b77676cc5d4f","observation_id":"5588daa0-1b4c-4c7b-a408-50218720e742","resolution":{"observed_at":"2026-08-03T20:30:26.075671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-03T20:30:26.189555Z","title":"Extending context window of large lan- guage models via positional interpolation.arXiv preprint arXiv:2306.15595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.189555Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:631e6c6360caaabf9be791710325979361216656635c23b3543fceeed1bde541","observation_id":"7c6ec55f-e690-4746-8d72-58c0828834fb","resolution":{"observed_at":"2026-08-03T20:30:26.189555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.361776Z","title":"Edt: An efficient diffusion transformer frame- work inspired by human-like sketching.Advances in Neu- ral Information Processing Systems, 37:134075–134106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.361776Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:aacedfd331f2520862951f1c19286c9c0ed9a0f1509868f85313af17475b06be","observation_id":"a2e19cb9-4de0-4135-ac68-b011db4bdc88","resolution":{"observed_at":"2026-08-03T20:30:26.361776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.473632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.473632Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:61c3a2774f9c1f64ce4727c17c9d3f89c6e2c64936e3ff047a1fe58a1f70bc19","observation_id":"4e29edbd-83ab-4221-b045-18cc10660614","resolution":{"observed_at":"2026-08-03T20:30:26.473632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.567061Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240): 1–113, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.567061Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:1cbe1971a98bdb0a248eac433e4e3ed073ac27c738c7422262b3750eb6b8e3b2","observation_id":"872c2f40-386c-4e93-911d-6117ec0833da","resolution":{"observed_at":"2026-08-03T20:30:26.567061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.674812Z","title":"A deep multi-level network for saliency prediction","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.674812Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b755947311e58fe59b8c6571e59ad7f94ac39082d7e16b8df864013735cf03b3","observation_id":"e6c34b0e-8c19-4989-9c03-71af22d830fa","resolution":{"observed_at":"2026-08-03T20:30:26.674812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.844453Z","title":"Predicting human eye fixations via an lstm- based saliency attentive model.IEEE Transactions on Im- age Processing, 27(10):5142–5154, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.844453Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:d1726e700ce6d1473a1d5e44cd48808a24abd2d648b9171d67476d9c17156aef","observation_id":"144134a0-3b22-49fa-87ea-4ea9766ce396","resolution":{"observed_at":"2026-08-03T20:30:26.844453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:26.960316Z","title":"Scalable high-resolution pixel-space image syn- thesis with hourglass diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:26.960316Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:20a80770b7816d0c94b918898576f337798b989103814607c3af4be8d97c8b6a","observation_id":"68c5359b-fe50-4902-bf35-f223422e013d","resolution":{"observed_at":"2026-08-03T20:30:26.960316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.078408Z","title":"Vq4dit: Efficient post-training vec- tor quantization for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.078408Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:262b008d146f381ceaa073cff3e251afe02dc25ede80280f7d2899825f253710","observation_id":"1068bbf4-d072-40c3-be15-91da4d90bc12","resolution":{"observed_at":"2026-08-03T20:30:27.078408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-03T20:30:27.187880Z","title":"Longrope: Extending llm context window beyond 2 million tokens.arXiv preprint arXiv:2402.13753, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.187880Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:ab1b59e5865482a2b6a366aeb9d3a229a21455c0e5c49a21cbc6c20e597139c5","observation_id":"0a79e3c5-740c-42e9-a757-22671dbc3bd5","resolution":{"observed_at":"2026-08-03T20:30:27.187880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.347342Z","title":"Patched denoising diffusion models for high-resolution im- age synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.347342Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:416763d6d22b92d5580f66a2e3ec3f1ae7ac38d9c9eb05d2a7fa7ba00a7f343b","observation_id":"cf80460a-6c2b-48bc-a018-62cc57746575","resolution":{"observed_at":"2026-08-03T20:30:27.347342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T20:30:27.468116Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.468116Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:9226029d4c806591ac60cafa6c6e836ac43a5850775b33d8b73deda06469c497","observation_id":"36ffeeff-54bb-4c40-b31b-26a1052cbebb","resolution":{"observed_at":"2026-08-03T20:30:27.468116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.616912Z","title":"Fewer denoising steps or cheaper per-step inference: Towards compute-optimal dif- fusion model deployment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.616912Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c8a6b5e1791d88d60daa6e4803060c366f3adae940d238b0436cc72f9cfe001b","observation_id":"4f8fe5bc-c994-4e68-8217-1287edfd8125","resolution":{"observed_at":"2026-08-03T20:30:27.616912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.742484Z","title":"The llama 3 herd of models.arXiv e-prints, pages arXiv–2407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.742484Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:9399be3e135d049719c15641d6bdad717da0782954d64f7053bfb11d559ef3e6","observation_id":"9409960e-5c80-44f4-b2e3-08d5520fc90d","resolution":{"observed_at":"2026-08-03T20:30:27.742484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.877245Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.877245Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:d480ceaa9919c1ec2859539d88db3d2644e9acad5331ab07ca83c8f74ff91831","observation_id":"17a3f926-b427-4a27-b36b-947dcb1dde41","resolution":{"observed_at":"2026-08-03T20:30:27.877245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:27.935055Z","title":"Structural pruning for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:27.935055Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b0e40e2afa308613f07098d6770dc23e161fdcc7e1989627874b6fb3a19b2a60","observation_id":"d9dd0a1b-53a7-4b98-ace5-bdb50f1fdf4d","resolution":{"observed_at":"2026-08-03T20:30:27.935055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.092684Z","title":"Tinyfusion: Diffusion transformers learned shallow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.092684Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b7921ba170bf76f79b58172af3683f6ac5ac92e6b42c5918d051ca6a88b4277d","observation_id":"0187e7f4-e393-4e2b-a618-cf7c7bfdd613","resolution":{"observed_at":"2026-08-03T20:30:28.092684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-19T16:28:33.825358Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10783","snapshot_observed_at":"2026-08-03T20:30:28.157199Z","title":"Video diffusion transformers are in-context learners.arXiv preprint arXiv:2412.10783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.157199Z"},"links":{"cited_paper":"/paper/2412.10783","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:515bd5fe015aa019a50b1ca9c277a3b60529faebd4964d214ab3f94e38301588","observation_id":"ed0d0cab-40ff-4c6f-ab86-bf5d9103ce55","resolution":{"observed_at":"2026-08-03T20:30:28.157199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.232564Z","title":"Relational diffu- sion distillation for efficient image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.232564Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:8a68c83273302b35c2537299024bc0ee194b767eba225e5cef6f160f71a05acd","observation_id":"d81bacbe-e3e6-48fd-9f36-fc2aa6052c75","resolution":{"observed_at":"2026-08-03T20:30:28.232564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.337950Z","title":"Romantex: Decoupling 3d-aware rotary positional embedded multi-attention network for texture synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.337950Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:38052e7c910cf69a25a7cb60403ed606918d02bfc5272c4f94ccd25e2367b44f","observation_id":"a5a37270-357e-45f6-892d-a32495f68057","resolution":{"observed_at":"2026-08-03T20:30:28.337950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12042","last_updated":"2025-02-11T15:58:10Z","snapshot_observed_at":"2026-08-16T13:42:05.633169Z","submitted_at":"2024-06-17T19:22:04Z","title":"Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12042","snapshot_observed_at":"2026-08-03T20:30:28.408897Z","title":"Not all prompts are made equal: Prompt- based pruning of text-to-image diffusion models.arXiv preprint arXiv:2406.12042, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.408897Z"},"links":{"cited_paper":"/paper/2406.12042","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b5c6fae25da2a819206c051d02b1d0735d6d3c3c828cc930c715cd3aac446ef9","observation_id":"8a365291-68ac-4f21-8736-ccee511e7369","resolution":{"observed_at":"2026-08-03T20:30:28.408897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T20:30:28.476861Z","title":"Deepseek-r1: Incentivizing reason- ing capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.476861Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:4addd7ca09f8ae77bf6593e7efee5081503d0c18fc4399a4dd987521f7329785","observation_id":"2ba9d8a4-e317-4b8a-bc94-b20cffabb96b","resolution":{"observed_at":"2026-08-03T20:30:28.476861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-03T20:30:28.542128Z","title":"Ltx-video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.542128Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f09e1c24a34962f939bbd651dcb68d24e8de9e6421d0524a65534cb528cf3c3b","observation_id":"8d5f83e2-0f82-4020-9611-f12717be5033","resolution":{"observed_at":"2026-08-03T20:30:28.542128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.619373Z","title":"Graph- based visual saliency","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.619373Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:91b9ac1862c6e9bc2e6ca436e9ab7ddf51a2c679af45cc3fbcdb04f5d15776aa","observation_id":"546baabb-291c-4beb-bd2d-f8ad39a5b053","resolution":{"observed_at":"2026-08-03T20:30:28.619373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.677368Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.677368Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:a484c9b09063f46e30459d114969f161101b5dffadb95c1b0eb3f67450cf734a","observation_id":"ccf80bf4-4d0b-4e9c-92a2-83feb7839497","resolution":{"observed_at":"2026-08-03T20:30:28.677368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.755185Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.755185Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:87f312fe570e9cbbe2ddfe84089c839e78843d84ce79499c9ad5cf6604040f70","observation_id":"77187c48-5a48-49e2-b234-0c0a8b8d999d","resolution":{"observed_at":"2026-08-03T20:30:28.755185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:28.842221Z","title":"Cascaded diffusion models for high fidelity image generation.Jour- nal of Machine Learning Research, 23(47):1–33, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:28.842221Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2d8a1a0bd166192bbfc1f6985a251f7ca5c0032928013830f4bbd19f5c9a2e3c","observation_id":"248eea44-bdfb-4dfe-ad25-52c4dc642e16","resolution":{"observed_at":"2026-08-03T20:30:28.842221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.000662Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.000662Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:8b9847fbcd2c959dd5217927fc3a928ccc9e11dea494e41361a5e1c4ff46a534","observation_id":"5f8f55c7-5e8a-455f-8e41-d7806714a872","resolution":{"observed_at":"2026-08-03T20:30:29.000662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.142233Z","title":"A model of saliency-based visual attention for rapid scene analysis","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.142233Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f411c87b81baeb1997235f6563f7118a86f0f8554b1ef88661ac88ee2b246d6b","observation_id":"7295cc68-5800-4810-a296-ca5e52085c6c","resolution":{"observed_at":"2026-08-03T20:30:29.142233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.326199Z","title":"Latent space super-resolution for higher-resolution image generation with diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.326199Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:8d51ca3bb92e338d860409da0bef285c0d348b5562af9f2a6305a7d472197765","observation_id":"c86b0e01-4133-4ba2-96df-7212a577672b","resolution":{"observed_at":"2026-08-03T20:30:29.326199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.575894Z","title":"Upsample what matters: Region-adaptive latent sampling for accelerated diffusion transformers.arXiv preprint arXiv:2507.08422, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.575894Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6ee7616e54120818d2a4dfd00924dce65a1996f5ee2da10e70df0b2e35537007","observation_id":"280e60da-f509-4285-a385-804752bfedb4","resolution":{"observed_at":"2026-08-03T20:30:29.575894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.715927Z","title":"Eml-net: An expandable multi- layer network for saliency prediction.Image and vision computing, 95:103887, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.715927Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:4fb4586df599694c2137882348d4d6784f48de91ceac38ee88a9a181795859bc","observation_id":"2fa753cc-1c5f-4ee9-a9b7-a183b32eb2bd","resolution":{"observed_at":"2026-08-03T20:30:29.715927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.858636Z","title":"Salicon: Saliency in context","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.858636Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:64c00171c88cea350ec6a7a986e94f666c074fe33ccffbae6173171dd0143076","observation_id":"d1937e08-c35d-4c47-972b-112590eb5f54","resolution":{"observed_at":"2026-08-03T20:30:29.858636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:29.974815Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:29.974815Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:9d409b92cdbb9950ea26a9cfa84754771964548e3fe7f4fcd6a9d9f3dbd1e1ba","observation_id":"0ceca32e-d177-4023-9dfa-0cf33affaaf4","resolution":{"observed_at":"2026-08-03T20:30:29.974815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.112218Z","title":"Adaptive caching for faster video generation with dif- fusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.112218Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b1494fa46280cf4a8993bd40ccfcd062de37c530212d9dfa4d7944c84f2f8f89","observation_id":"3d7befc1-7629-43f3-bd81-ddfde1b206e1","resolution":{"observed_at":"2026-08-03T20:30:30.112218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.344863Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.344863Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:7274fff30df3960b0a2253a1aabae1aeb18cf077efd5cb55755523e01991572d","observation_id":"e1e05970-e027-4bbb-b696-698472925ad3","resolution":{"observed_at":"2026-08-03T20:30:30.344863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.498070Z","title":"A nonparametric approach to bottom- 10 up visual saliency.Advances in neural information process- ing systems, 19, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.498070Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:200ba8d1e2bc30e8a126f0fed9568dba2c66a843d1455421165f5f369e0c5045","observation_id":"0d4714d8-7548-4eb4-b333-afe636b7e11e","resolution":{"observed_at":"2026-08-03T20:30:30.498070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.577184Z","title":"Diffusehigh: Training-free progressive high- resolution image synthesis through structure guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.577184Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c8e6d02aa0cb28061876b7d3929b982468992ebb9eac78ce724a63c860ace520","observation_id":"600f4bfc-e528-40ef-b9f0-4f55c436e1a5","resolution":{"observed_at":"2026-08-03T20:30:30.577184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.724201Z","title":"Imagenet classification with deep convolutional neural net- works.Advances in neural information processing systems, 25, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.724201Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:954fe21f934d1441de8363ac46d6f676fe9558a43a9024cc38b73018f50e6ff0","observation_id":"5a831529-3082-4b98-8607-96844a6a58f2","resolution":{"observed_at":"2026-08-03T20:30:30.724201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:30.874020Z","title":"Deepfix: A fully convolutional neural network for predicting human eye fixations.IEEE Transactions on Im- age Processing, 26(9):4446–4456, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.874020Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:19dc7ed0c87f03afad3e6a8e43a0b195132783a243f45b14ae6dc8d4193c50f0","observation_id":"d04ba5e9-6847-447a-a7d8-02b12a54dd91","resolution":{"observed_at":"2026-08-03T20:30:30.874020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1045","last_updated":"2015-04-09T09:48:11Z","snapshot_observed_at":"2026-08-20T20:26:40.484156Z","submitted_at":"2014-11-04T20:56:51Z","title":"Deep Gaze I: Boosting Saliency Prediction with Feature Maps Trained on ImageNet","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.1045","snapshot_observed_at":"2026-08-03T20:30:30.977927Z","title":"Deep gaze i: Boosting saliency prediction with feature maps trained on imagenet.arXiv preprint arXiv:1411.1045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:30.977927Z"},"links":{"cited_paper":"/paper/1411.1045","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:47015138a9cf80fb0a822bc4560be7f280fd913c479981a8d71a4cab0b43a594","observation_id":"2ae04c54-a66e-4d87-b5fe-70fcc2d615c1","resolution":{"observed_at":"2026-08-03T20:30:30.977927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:31.131369Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.131369Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:d417531d40266d94ee19c19fba810378289d34ad55069bf213565201883ef657","observation_id":"fac82765-f947-49f6-b157-68ea30780dc9","resolution":{"observed_at":"2026-08-03T20:30:31.131369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-16T21:22:40.755328Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12391","snapshot_observed_at":"2026-08-03T20:30:31.258053Z","title":"Efficient scaling of diffusion transformers for text-to-image generation.arXiv preprint arXiv:2412.12391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.258053Z"},"links":{"cited_paper":"/paper/2412.12391","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6fb00180e1b0bb9f022cc119ed47614db067913dc0a442c5a93a5f3194680794","observation_id":"e89e2380-e22a-43ab-8d62-db81ad126e7e","resolution":{"observed_at":"2026-08-03T20:30:31.258053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:31.362208Z","title":"Svdquant: Absorbing outliers by low- rank components for 4-bit diffusion models.arXiv preprint arXiv:2411.05007, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.362208Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:59856c2f0781033dbe18b5657e7342fdead63a9a1b0115bc7df38dcce9322c28","observation_id":"c4fe7fb6-23de-4a0f-bf49-78cbefad256a","resolution":{"observed_at":"2026-08-03T20:30:31.362208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:31.537494Z","title":"Snapfusion: Text-to-image diffusion model on mobile de- vices within two seconds.Advances in Neural Information Processing Systems, 36:20662–20678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.537494Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:74a3c60a78d51aaf6453ef2c0278fa1263c58a27815528324885c8dd997f2c2a","observation_id":"82cc4082-8d26-4b12-81c4-ecef451579e8","resolution":{"observed_at":"2026-08-03T20:30:31.537494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T20:30:31.643191Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.643191Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:7710f529de1b506a256311c90766067eb53bd31bb88722ab297523696cfa8530","observation_id":"001e6a19-564b-40af-aef8-eb00406fd66b","resolution":{"observed_at":"2026-08-03T20:30:31.643191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:31.827071Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.827071Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6252a8604a314ffd6cc22d28912e71c48bc0222bb42a893c96da068cb891b4f6","observation_id":"f325ef30-433a-4cfe-a48a-9486290203bc","resolution":{"observed_at":"2026-08-03T20:30:31.827071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:31.894657Z","title":"Deepgaze iie: Calibrated prediction in and out-of-domain for state-of-the-art saliency modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.894657Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:8afa8ca34b42300c87d43908c4a9c7b77de6847d87e52c7323bdca2e71735fdd","observation_id":"20da9d7f-3dea-4ca2-9fd8-cdbd06dac9af","resolution":{"observed_at":"2026-08-03T20:30:31.894657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.054671Z","title":"Deepgaze iie: Calibrated prediction in and out-of-domain for state-of-the-art saliency modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.054671Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:1b823d308f718c1a38f1c4ed1383c6dbf9c8541fa2bffbb791be0f5064f987cb","observation_id":"33e8180f-4855-4242-861a-8623b62671ea","resolution":{"observed_at":"2026-08-03T20:30:32.054671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.092733Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.092733Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:e97693e73080ebcd84fe57e5cdf426719e7fa530e942d8c776b4f76c17f8bb1e","observation_id":"3ca96e00-8c93-4b9f-b8a6-b616f38bb42b","resolution":{"observed_at":"2026-08-03T20:30:32.092733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.157068Z","title":"A deep spatial contextual long- term recurrent convolutional network for saliency detec- tion.IEEE Transactions on Image Processing, 27(7):3264– 3274, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.157068Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:549a5002436644cd378e6e27963689db2309b0e0dc9b0233a244f675399905d0","observation_id":"03de78ed-b131-443d-8cea-80a3517d048e","resolution":{"observed_at":"2026-08-03T20:30:32.157068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.329297Z","title":"Region-adaptive sampling for diffusion transformers.arXiv preprint arXiv:2502.10389, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.329297Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:b3135b95276b3f4c0d97f2eff2a806b2d665f9e5742b86e81ec80608b962d5a3","observation_id":"e5405504-91a3-4605-9e65-3464cc9dbd0b","resolution":{"observed_at":"2026-08-03T20:30:32.329297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.449314Z","title":"Transalnet: Towards perceptually relevant visual saliency prediction.Neurocomputing, 494:455–467,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.449314Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:be7525eea7fe7ba0f2355d312567930d04c3b54acf9997feacf159acec54cfc0","observation_id":"6afdf2cb-377b-4aa2-b498-c065d578fc41","resolution":{"observed_at":"2026-08-03T20:30:32.449314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.551857Z","title":"Token caching for diffusion transformer accel- eration.arXiv preprint arXiv:2409.18523, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.551857Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5ae1cde29ae0ebe083407142d55354f2e77a505c7e42d70354666621bc484916","observation_id":"b586c417-93e3-4c4e-9dc5-9649d0600ded","resolution":{"observed_at":"2026-08-03T20:30:32.551857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.627689Z","title":"Dpm-solver: A fast ode solver for diffu- sion probabilistic model sampling in around 10 steps.Ad- vances in neural information processing systems, 35:5775– 5787, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.627689Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5b0681479bae5a93e48de4c6a759fe28e388335f65666d3192b104105dba549d","observation_id":"89ea124f-8d33-4c80-aa5a-6eb4ed223bad","resolution":{"observed_at":"2026-08-03T20:30:32.627689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:32.746814Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models.Machine Intel- ligence Research, pages 1–22, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.746814Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5837bd303efa66298fbdc6413713b98ec5ddaeff39d2fbea7cf8c389ba2f3611","observation_id":"df1ce7f7-9112-4057-83da-c3de12473991","resolution":{"observed_at":"2026-08-03T20:30:32.746814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-18T14:41:50.960509Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-03T20:30:32.838768Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.838768Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6344eb3fb37edbc9ed69ac015b9f2d4d3680d57b3a6dc5ba149f6fdb90b33413","observation_id":"f64126a2-b27a-449b-8818-07cfecbbca4b","resolution":{"observed_at":"2026-08-03T20:30:32.838768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-08-20T13:49:06.053430Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-03T20:30:32.920590Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference.arXiv preprint arXiv:2310.04378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.920590Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:fd4a8d7e19cb7a2dd93e222dee374bb26793d4cd276f283629da2f2031079a72","observation_id":"0d3fdb25-7947-4c8d-a7b7-cb140fa83d97","resolution":{"observed_at":"2026-08-03T20:30:32.920590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19355","last_updated":"2025-03-12T03:40:38Z","snapshot_observed_at":"2026-08-16T13:06:02.179146Z","submitted_at":"2024-10-25T07:24:38Z","title":"FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19355","snapshot_observed_at":"2026-08-03T20:30:32.981278Z","title":"Fastercache: Training-free video diffusion model acceleration with high quality.arXiv preprint arXiv:2410.19355, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.981278Z"},"links":{"cited_paper":"/paper/2410.19355","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f317d0721588cc25d505ee9de9c54e72d7ca0b7487e9e22a6c109e1fc9bd84a4","observation_id":"883b67b1-ee34-4df6-95a6-472c4a70a443","resolution":{"observed_at":"2026-08-03T20:30:32.981278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.030512Z","title":"Video saliency forecasting transformer.IEEE transactions on circuits and systems for video technology, 32(10):6850–6862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.030512Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:785abe1d60ebafe6e96445598a586a9ec81708d0dd7eff56517879d26c580c98","observation_id":"ee4ec104-5a3d-4396-8999-cca2cc647b36","resolution":{"observed_at":"2026-08-03T20:30:33.030512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.116605Z","title":"Learning-to-cache: Accelerating diffusion trans- former via layer caching.Advances in Neural Information Processing Systems, 37:133282–133304, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.116605Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:60b68464759c500c0640300b9e8a5c0ac47b3eea9223deb85bcfec1c1d34a330","observation_id":"98cc296d-39f4-4339-b1be-0c7cea862a45","resolution":{"observed_at":"2026-08-03T20:30:33.116605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.252340Z","title":"Deepcache: Accelerating diffusion models for free","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.252340Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:655da7fbe9128e39eda5e3766218b4cd13c09f5c7d9c8e8fa87bb23cc49294a5","observation_id":"01d30cb4-c66b-4087-a6b1-a0e62464c120","resolution":{"observed_at":"2026-08-03T20:30:33.252340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-03T20:30:33.319218Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.319218Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:956b4f6776380f6e4d15aa0277c0ce5f2ba99869a754f236e9ba24a7301fd55a","observation_id":"484e2779-171b-4140-b1c7-e6fe2678e603","resolution":{"observed_at":"2026-08-03T20:30:33.319218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.426515Z","title":"Magcache: Fast video generation with magnitude- aware cache.arXiv preprint arXiv:2506.09045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.426515Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:13813bd3465a3f506e7f0f6fd24461e81e0438dc7262a6ad5d801d2aadad9d19","observation_id":"d25ffed7-2d32-4c7c-b8a8-4693e20ad475","resolution":{"observed_at":"2026-08-03T20:30:33.426515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10322","last_updated":"2025-08-16T06:26:50Z","snapshot_observed_at":"2026-08-16T13:42:52.038332Z","submitted_at":"2024-06-14T17:41:55Z","title":"LieRE: Lie Rotational Positional Encodings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10322","snapshot_observed_at":"2026-08-03T20:30:33.510808Z","title":"Liere: Gen- eralizing rotary position encodings.arXiv preprint arXiv:2406.10322, 2(4), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.510808Z"},"links":{"cited_paper":"/paper/2406.10322","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:166d9c67697dd21ec8a02b7f4b725f5f8d7b897bd9461097d075d769d0090c8f","observation_id":"a7c2cf35-981b-40a3-b56e-b167401d6275","resolution":{"observed_at":"2026-08-03T20:30:33.510808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.662966Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.662966Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:7ee8705f09eb2601cebe66087c9776c809a3d829e66e7c4442699558fb4da78d","observation_id":"dc8b98ff-ce4a-4a2d-bcd6-fa3ad6a06555","resolution":{"observed_at":"2026-08-03T20:30:33.662966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:33.839699Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size without any fine-tuning and minimal perplexity degrada- tion, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.839699Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:4a7d4cb5f6b5093594358a50771a37edda595f9a5d65bff9834f01c8181deabb","observation_id":"3f0bc936-b6ed-40cb-b2bc-96eb100559d9","resolution":{"observed_at":"2026-08-03T20:30:33.839699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-03T20:30:33.948881Z","title":"Yarn: Efficient context window extension of large language models.arXiv preprint arXiv:2309.00071, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:33.948881Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5948fd13da5e630ed4b440da25e101a23796f75c6dd2077b77f39c87de35e941","observation_id":"7acbadee-78d0-4b3e-ab79-71a90e569547","resolution":{"observed_at":"2026-08-03T20:30:33.948881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00637","last_updated":"2023-09-29T05:32:46Z","snapshot_observed_at":"2026-08-16T15:27:32.220354Z","submitted_at":"2023-06-01T13:00:53Z","title":"Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00637","snapshot_observed_at":"2026-08-03T20:30:34.111709Z","title":"W ¨urstchen: An efficient architecture for large-scale text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.111709Z"},"links":{"cited_paper":"/paper/2306.00637","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:9e41cc9dab7de58fb572520afc76bc31b56fb88078a4cc1aac011d4a43f62e52","observation_id":"4381c461-4fd7-47eb-bc14-b5188c581c79","resolution":{"observed_at":"2026-08-03T20:30:34.111709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T20:30:34.229570Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.229570Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:612ec7dae979ac4673f145a808eeabfb5dc5006ecbabc92630f1d6bead9d8777","observation_id":"3713926a-4465-4e44-9092-995673139acc","resolution":{"observed_at":"2026-08-03T20:30:34.229570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:34.306733Z","title":"Video motion transfer with diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.306733Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:dbced9ea9ac1526d3f9842f40d384a48bca0a8fbd9af9e5f505b685142cafed2","observation_id":"da37359e-8e51-42a0-a18e-aead4df6f9cc","resolution":{"observed_at":"2026-08-03T20:30:34.306733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-03T20:30:34.416673Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation.arXiv preprint arXiv:2108.12409, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.416673Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:f8014c3a9bf2a888585a26e8f092b9ed20394d89ea5f7f4945dd056b62d13f91","observation_id":"bc663ef4-c0fc-4c63-8195-2921165c76cd","resolution":{"observed_at":"2026-08-03T20:30:34.416673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15774","last_updated":"2025-08-21T17:59:57Z","snapshot_observed_at":"2026-08-17T04:10:52.927125Z","submitted_at":"2025-08-21T17:59:57Z","title":"CineScale: Free Lunch in High-Resolution Cinematic Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15774","snapshot_observed_at":"2026-08-03T20:30:34.493567Z","title":"Cinescale: Free lunch in high-resolution cinematic visual generation.arXiv preprint arXiv:2508.15774, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.493567Z"},"links":{"cited_paper":"/paper/2508.15774","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:74bb9e3dc2f0edbd55810803cf31c160de9dc57d6c5436f11b6fc09997208fe0","observation_id":"13039da8-6b1c-4595-a602-72480932028e","resolution":{"observed_at":"2026-08-03T20:30:34.493567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:34.564222Z","title":"Freescale: Unleashing the resolution of diffusion mod- els via tuning-free scale fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.564222Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:57c26bac38326e3e310ad26b2f7ad32dd3adae6b27103db3e3d15d9298639daa","observation_id":"89bab8a5-c88d-46ef-844a-89cf0a7fa820","resolution":{"observed_at":"2026-08-03T20:30:34.564222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:34.747012Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.747012Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:57dcb293d82e5be90d3137d998161ed192d06205b1d3fd831e31d8781dd9247b","observation_id":"2295b7ac-8185-43c4-a9b7-df3ad4ed4ab2","resolution":{"observed_at":"2026-08-03T20:30:34.747012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-03T20:30:34.898300Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.898300Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2d9dcee2374ad051ecf48dddef5c4991d37ac5353ad0564f30991fa7fe962d91","observation_id":"14e76cb2-00d3-425c-9c4f-7b750957498c","resolution":{"observed_at":"2026-08-03T20:30:34.898300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:34.997458Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:34.997458Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6aaf8b9c81b0f4d874e4d41e231e95102c94679bcea48412007fd104ddcd1830","observation_id":"4d77bf99-93e8-4681-9931-55517ce6c520","resolution":{"observed_at":"2026-08-03T20:30:34.997458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:35.104572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural in- formation processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.104572Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:6bd48701ea3b4b2f0d06c2258079050b75f289f12bbf453af139323d2486cbb5","observation_id":"6b3dc856-a6ab-4b9e-adb0-6f8f94c9396d","resolution":{"observed_at":"2026-08-03T20:30:35.104572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-03T20:30:35.167060Z","title":"Progressive distillation for fast sampling of diffusion models.arXiv preprint arXiv:2202.00512, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.167060Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2eccf7e546b8bc1623ac063ea302041c27852a436293191220b01b0394de17ea","observation_id":"0cfa7333-14eb-4e27-bf43-41cb2ee2cfa0","resolution":{"observed_at":"2026-08-03T20:30:35.167060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08690","last_updated":"2025-02-12T15:03:26Z","snapshot_observed_at":"2026-08-17T12:02:37.833524Z","submitted_at":"2025-02-12T15:03:26Z","title":"Skrr: Skip and Re-use Text Encoder Layers for Memory Efficient Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08690","snapshot_observed_at":"2026-08-03T20:30:35.268665Z","title":"Skrr: Skip and re-use text encoder layers for memory efficient text-to-image generation.arXiv preprint arXiv:2502.08690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.268665Z"},"links":{"cited_paper":"/paper/2502.08690","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c74e1e440b628e73a53d602c6443563ed2a573d9f3bc6f14ee5769d9be68d52a","observation_id":"b348a2c2-8752-421b-ba4d-59a4ee94ed26","resolution":{"observed_at":"2026-08-03T20:30:35.268665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:35.377423Z","title":"Post-training quantization on diffusion models","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.377423Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:5c3b7177ca7073d1becb1f5ebeafe7194d5667db2a4d7a1a7206f157483f15d0","observation_id":"7405d1a7-eb55-41b9-a805-f35dbe90a15b","resolution":{"observed_at":"2026-08-03T20:30:35.377423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T20:30:35.520090Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.520090Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2a4f688f08546250e9cfe84d399cd4c6856fe575bf0353bf6110621277f82ccc","observation_id":"1a2304ef-5e90-4ab0-86d5-1e419724144f","resolution":{"observed_at":"2026-08-03T20:30:35.520090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-03T20:30:35.671896Z","title":"Very deep convo- lutional networks for large-scale image recognition.arXiv preprint arXiv:1409.1556, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.671896Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:2232ae85509babe4dea933195802ca5a7f9169525b9272451fe04052d6dda57a","observation_id":"453e8f68-bf2a-4d2d-b1fb-9e17d941db41","resolution":{"observed_at":"2026-08-03T20:30:35.671896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-03T20:30:35.798920Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.798920Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:cfbe1892507a3f7e7c6100d00d0af0482701bdc812347f2cb761f4e1709dd77e","observation_id":"c2048fbb-e6cc-477f-abb4-7b44fae98295","resolution":{"observed_at":"2026-08-03T20:30:35.798920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-15T07:00:23.337991Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-03T20:30:35.913201Z","title":"Consistency models.arXiv preprint arXiv:2303.01469, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:35.913201Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:908eefc054fca88359a686f4d247fa92be1272384e2e149c90a465bc3477e3ca","observation_id":"40868428-7d8b-44ff-a323-6185ac1ff1c7","resolution":{"observed_at":"2026-08-03T20:30:35.913201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:36.044216Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568: 127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:36.044216Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:cf64b6f26995aa6d8b6591c91df6bca771a22019ff3680c83103e2aedcc55622","observation_id":"1bb7fe64-0adc-443c-aff9-4770f27f69de","resolution":{"observed_at":"2026-08-03T20:30:36.044216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:36.151686Z","title":"A length-extrapolatable transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:36.151686Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:c39eef5b49d95fd0b76494364fdb1ca5a69ceba3d7b13fc2c9a595836965fcd4","observation_id":"c5904c76-8d9f-405f-84f7-29e461304773","resolution":{"observed_at":"2026-08-03T20:30:36.151686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:30:36.264238Z","title":"Exploring the deep fusion of large language models and diffusion transformers for text-to-image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:36.264238Z"},"links":{"citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:eea40a6117a6e8e4d993a76638fbc16fe6b58b5a787516c8925f7cd28649c56b","observation_id":"88bd2714-ba7c-4634-a4d8-d1705cc6c909","resolution":{"observed_at":"2026-08-03T20:30:36.264238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-03T20:30:36.333846Z","title":"Gemma: Open models based on gemini research and tech- nology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:36.333846Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:817c2ab7e334abfad2db66842b3c19b09156eea1b36e4659c34ea69e2b44e57f","observation_id":"0162a3f4-26f2-4996-b7aa-0a5b26d00a8b","resolution":{"observed_at":"2026-08-03T20:30:36.333846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 0 inbound Pith citation observations for arXiv:2511.19778."}