{"as_of":"2026-08-07T16:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa5f3a90d87d35b593dbc3e9bd80f49d08964f2b1c79002d5b5df91075912856","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:47:52.456480Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04421/citation-record","integrity":"/paper/2506.04421/integrity","json":"/paper/2506.04421/citation-record.json","paper":"/paper/2506.04421"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:47:52.250463Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.250463Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:bfa29db48e0ca59ae2e65ed73382e52afc49608287df2e7c1b4abc6db007dff4","observation_id":"c053797f-87d7-4919-975a-afd1204afb4f","resolution":{"observed_at":"2026-08-07T10:47:52.250463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.190261Z","title":"University of Maryland Computer Science, 1980","venue":null,"work_id":"fb2d557c-9d67-426a-90c6-9885e2619478","year":1980},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.255049Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:2f9309dbf005dc5121703c93605ba87c77cfc8375a0b878636f30d6241cf7821","observation_id":"aa04c33c-865c-483d-9ebf-ccdd7bbc2981","resolution":{"observed_at":"2026-08-07T10:47:53.194608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.179109Z","title":"Beit: Bert pre-training of image transformers, 2022","venue":null,"work_id":"b040eb1c-b725-4f84-a0c7-47d57df84445","year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.258971Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:1247e2bb0ae9cc7aee15b9d3738b35bfc14027a318b0294771e51e070cad7913","observation_id":"6581cacf-b03d-47c4-af30-8078c11493c1","resolution":{"observed_at":"2026-08-07T10:47:53.182978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.167413Z","title":null,"venue":null,"work_id":"fb5eecb5-37d0-47ba-91ca-45f24e6ddb90","year":2020},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.262746Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:f0059e59b4e014fd485721e11c61f85e39e4f3bc4afaf12be26be473b2e219f5","observation_id":"2f7e941c-4b92-49a8-886c-f56067305d7b","resolution":{"observed_at":"2026-08-07T10:47:53.171134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.155790Z","title":"The laplacian pyramid as a compact image code","venue":null,"work_id":"36096b5a-03d9-434b-9f48-7eec4e89b769","year":1987},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.266439Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:fcc7fc73a8dba66d1c3812dfdae06497f2d98d1173dd100cbcb3d571078e56fc","observation_id":"5c6cf2f0-a3a2-443d-a61f-46ca513c3a29","resolution":{"observed_at":"2026-08-07T10:47:53.159871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.144362Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"f763914c-faed-411f-b655-38959eaf66ae","year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.270043Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:0a1b8e911e760c1afd8ffd9195ef0c1f5e92128ba687892216e4b2b581ee9438","observation_id":"e38d3b98-b05d-425b-b048-623a547ab42c","resolution":{"observed_at":"2026-08-07T10:47:53.148190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T10:47:52.273933Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.273933Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:f8b804ad8801d1a88b0b8563be48fc463c1dad38ef53fc4f6a0890f59f08fb0c","observation_id":"4b2b60c7-2598-43c8-ad79-1de3049e13ba","resolution":{"observed_at":"2026-08-07T10:47:52.273933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17787","last_updated":"2024-11-26T15:13:15Z","snapshot_observed_at":"2026-07-06T19:57:33.013839Z","submitted_at":"2024-11-26T15:13:15Z","title":"Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17787","snapshot_observed_at":"2026-08-07T10:47:52.277927Z","title":"Collaborative decoding makes visual auto-regressive modeling efficient.arXiv preprint arXiv:2411.17787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.277927Z"},"links":{"cited_paper":"/paper/2411.17787","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:a8a58d32d212747b2a2b8267d124d8f8a529e84de99663461c7a559033a5476c","observation_id":"13a7575a-d813-492b-87e7-ed2d4d607f4f","resolution":{"observed_at":"2026-08-07T10:47:52.277927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.133160Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"6bfa50a5-5b65-4d68-9e99-b5dd6dde627a","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.281764Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:bfe2d8368531f46a7c2f1e18f8574f1ce20ac1da34a699e04a37d1d2500154ed","observation_id":"af8e63dc-f98b-413d-8cca-ea8010863ff2","resolution":{"observed_at":"2026-08-07T10:47:53.136932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.121351Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"f63d3f0a-940c-419d-8a1d-144cebd4acce","year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.285069Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:f1d4168103bd9f5a0db2be2f211de3d1b66a83302fb7b00931b5b876ab2050da","observation_id":"5125b919-3f36-46a3-9248-0f01911bbf87","resolution":{"observed_at":"2026-08-07T10:47:53.125367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.105786Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":"f173037f-b09d-441c-985e-648b27c9ac1d","year":2019},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.289091Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:bea66e8991899fb52f11265552ac8e1ad0d7633ad4102be7982694c87082c899","observation_id":"f11f1bca-e75e-419c-bd4a-350708fe3a35","resolution":{"observed_at":"2026-08-07T10:47:53.110666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.094066Z","title":"Diffusion models beat gans on image synthesis.Advances in neural information processing systems, 34:8780–8794, 2021","venue":null,"work_id":"4a189991-18af-457f-8e5d-dbee23c116d3","year":2021},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.292717Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:4e245e08858dee82e679af02e2b3e1a80ee0ec2246b2c57e032a39773c952af7","observation_id":"959a6296-762e-4901-9efd-1fde7162c539","resolution":{"observed_at":"2026-08-07T10:47:53.098183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.083405Z","title":"Noise schedules considered harm- ful","venue":null,"work_id":"a74bea88-828d-4443-8e07-4554f72833a0","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.296171Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:b1f720c1e1e4bae8a01f6f20ab0d5b95050180708d2d19b4ac5f3c1206515a97","observation_id":"575d0c18-2163-43dc-ab1e-fcd732b86897","resolution":{"observed_at":"2026-08-07T10:47:53.086760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.072637Z","title":"T aming trans- formers for high-resolution image synthesis, 2021","venue":null,"work_id":"e43ead2e-78de-4594-9acd-bde99a147c24","year":2021},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.299761Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:614993b89402caf53b14186154388f13f065bf5a37d9f4a5dafa2ad7ecff9f6a","observation_id":"4feb0e58-9bb5-4618-9281-fe32ea321bbd","resolution":{"observed_at":"2026-08-07T10:47:53.076430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15010","last_updated":"2025-06-30T10:25:40Z","snapshot_observed_at":"2026-07-06T19:20:23.589464Z","submitted_at":"2024-09-23T13:36:34Z","title":"DepthART: Monocular Depth Estimation as Autoregressive Refinement Task","version":3},"cited_work":{"arxiv_id":"2409.15010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15010","snapshot_observed_at":"2026-08-07T10:47:52.745304Z","title":"DepthART: Monocular Depth Estimation as Autoregressive Refinement Task","venue":"cs.CV","work_id":"392b6040-1b91-4a38-81a3-99b3bbdd24fd","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.303236Z"},"links":{"cited_paper":"/paper/2409.15010","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:cff0e7b2cdcd835eb1e32907d8beda0213546595e7772c46551f530a349a24d0","observation_id":"c4050efa-66f0-4ec4-b2d1-34275b6e9887","resolution":{"observed_at":"2026-08-07T10:47:52.750900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.061206Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":"a59e706d-df1e-462c-a219-d5581144d9e5","year":2014},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.307154Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:8b4374105ea8f9291aa60fd319dd00f49a65ff59ca3689b5b6e9f870e3affbce","observation_id":"45c54626-6508-4662-96a8-e5a45378ce35","resolution":{"observed_at":"2026-08-07T10:47:53.065240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-06T22:01:43.705500Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-07T10:47:52.310676Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.310676Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:37c63c8306cb156cd5969e0140f1d9e19766f45cebe8a8e623f9b76cb15ec210","observation_id":"44b005c6-cef6-4e40-918c-92d8ef2f4192","resolution":{"observed_at":"2026-08-07T10:47:52.310676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.047480Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":"2e9239c9-cd21-4ebe-86a1-ec5e0f6e4e48","year":2021},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.314162Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:95852d2c78c45c7a464667d1ba44e38e1b4266aca82b1add53690ef0e4d90895","observation_id":"d87f11cb-abb7-45df-a000-cbeb35e9d243","resolution":{"observed_at":"2026-08-07T10:47:53.052955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.033787Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"f4d7c40d-41c0-43ca-9684-d34ba4385863","year":2020},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.317767Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:5b42127c2b803a2497a5e2f0932765a807198c75b7754276944138d06c5b9451","observation_id":"340d8668-72db-48cc-bdd8-fa668de5bae9","resolution":{"observed_at":"2026-08-07T10:47:53.038876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.323197Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.323197Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:9b402ab6f67e137cbfcd5dd4b91de85414b0fdd1316b402811346148ff450ed3","observation_id":"b7542b77-7378-41e2-a9b5-744c86fe758a","resolution":{"observed_at":"2026-08-07T10:47:52.323197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T10:47:52.327745Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.327745Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:af73fc02ec3c0f8f508e161e67f31447c64ead32fa0926351c5938e0255700dc","observation_id":"8835ec52-b660-4b17-b396-eed5cf1b877d","resolution":{"observed_at":"2026-08-07T10:47:52.327745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.021812Z","title":"Autoregressive image generation using residual quanti- zation","venue":null,"work_id":"c5e35623-3b04-43a3-b0f6-4b4e44ab91ad","year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.331300Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:8b196a101f9195cbc96a7b9ba3603796215bc833980f88771c3255fa4c7c2a68","observation_id":"a35514f3-a387-4438-aa39-eae9476a5e70","resolution":{"observed_at":"2026-08-07T10:47:53.025690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:53.009988Z","title":"Mage: Masked generative encoder to unify representation learning and image synthesis","venue":null,"work_id":"1bf34643-5f47-4b05-b51d-c1cb3db362f3","year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.334676Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:a6d0d6ba0c5be0510153186301cad7db55b61b8fdaa94be00086af48696f822a","observation_id":"d19e8f89-a861-4736-b21d-c95d8aa57fce","resolution":{"observed_at":"2026-08-07T10:47:53.014313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.997542Z","title":"Autoregressive image generation without vector quantization, 2024","venue":null,"work_id":"e3f7ac03-014c-4dc8-ab85-f5ac8ecc7a78","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.338786Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:7789521148438995f899599a8928d683752d58193bfcc8693cb9c9f6aec330c0","observation_id":"f1a7f6e5-0b4c-4edc-ad8e-4145c55a1989","resolution":{"observed_at":"2026-08-07T10:47:53.002000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-07T10:47:52.342304Z","title":"Imagefolder: Autoregressive image generation with folded tokens.arXiv preprint arXiv:2410.01756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.342304Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:b1adf3e2f4e8f1c70d4fa1b6d679e534208ef55bef2e1ebd9821acebddde60bc","observation_id":"e7402fdf-de54-43c8-b179-ba2822a82963","resolution":{"observed_at":"2026-08-07T10:47:52.342304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09750","last_updated":"2024-10-02T02:10:26Z","snapshot_observed_at":"2026-07-06T18:30:46.405694Z","submitted_at":"2024-06-14T06:35:33Z","title":"ControlVAR: Exploring Controllable Visual Autoregressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09750","snapshot_observed_at":"2026-08-07T10:47:52.346186Z","title":"Controlvar: Exploring controllable visual autoregressive modeling.arXiv preprint arXiv:2406.09750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.346186Z"},"links":{"cited_paper":"/paper/2406.09750","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:786d69adf3228a5906a30f7dd8115eacb27038dd1b8f82f202d623954ed735f3","observation_id":"afdf6c29-8c14-457a-a8df-340057037d80","resolution":{"observed_at":"2026-08-07T10:47:52.346186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08579","last_updated":"2024-03-15T02:02:21Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:59:34Z","title":"HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08579","snapshot_observed_at":"2026-08-07T10:47:52.350329Z","title":"Hyperhuman: Hyper-realistic human generation with latent structural diffusion.arXiv preprint arXiv:2310.08579, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.350329Z"},"links":{"cited_paper":"/paper/2310.08579","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:b5fa47ae4d92d15e32d8cd5d70934473a4ef2f99174b9cda09d16b8354627809","observation_id":"ea9a6aa6-d05d-49a8-a8b9-04b1de53bd10","resolution":{"observed_at":"2026-08-07T10:47:52.350329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-07T10:47:52.354040Z","title":"Star: Scale-wise text-to-image generation via auto-regressive representations.arXiv preprint arXiv:2406.10797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.354040Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:486be7ff15f0093eb0670cf1671750c2ec332f6dc2306b1bab66970d1a1f5596","observation_id":"06fa2f40-40c5-40af-95fe-3536cf40a909","resolution":{"observed_at":"2026-08-07T10:47:52.354040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.985121Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":"a8d231ce-870a-4409-bdea-6837c2587ea8","year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.357814Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:71ee490b5d97be4ebf8d59a040c01f52ad2de2428470d90c986f5366dd513602","observation_id":"ef26e0c2-7e45-4a3a-a265-3152ba24e83f","resolution":{"observed_at":"2026-08-07T10:47:52.989159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.973971Z","title":"Flexattention: The flexibility of py- torch with the performance of flashattention","venue":null,"work_id":"26892696-1955-48c2-a703-4c695ec9e948","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.361391Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:0203f7bb4fe7c2f2108dd4515639fd658cb465168c3730698412595e0ca5b713","observation_id":"dcc285a9-6adb-4d8c-a44e-4b7a334b0de5","resolution":{"observed_at":"2026-08-07T10:47:52.977718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T10:47:52.364862Z","title":"Self-attention does not need O(n2)memory.arXiv preprint arXiv:2112.05682, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.364862Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:965f2f767531ff86f532663fc0a1e24f1290c6f6cd6a98ad885152dd8967eb6c","observation_id":"89ad099d-36a3-4b2d-bd40-0f1fcc7e8357","resolution":{"observed_at":"2026-08-07T10:47:52.364862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.962998Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"248efa94-0e72-471c-981e-ee1b37fb19bb","year":2018},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.368820Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:3a0607e1515bab2432a4e80489911b67e3d2d78b5a085a006d4af5822dc2c9b8","observation_id":"d15b2735-1f59-4d79-920a-5bfcffd9a467","resolution":{"observed_at":"2026-08-07T10:47:52.966640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.951799Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":"c71a491c-3926-4aa2-8455-a25fe0f72920","year":2019},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.372382Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:6cecfcb04c70c7164cf52c10df165d66ebee598d059113211a36aeb2c5f350aa","observation_id":"139fecc1-6eb8-46dd-a9ad-b8f6e5740957","resolution":{"observed_at":"2026-08-07T10:47:52.955677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T10:47:52.375704Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.375704Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:5e1cb11dead8c667b689f817475a92090a29901e14c700d5baa090930b02d92d","observation_id":"82a435d5-34b0-4554-868d-e88eb54ac1b0","resolution":{"observed_at":"2026-08-07T10:47:52.375704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.940849Z","title":"Generating diverse high-fidelity images with vq-vae-2.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"07e2fb6d-014d-44f8-b468-82f0b44bc013","year":2019},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.379403Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:d06c344f71f27c1915a884167ca61340a27d71e3fb21c183685c40a5c5701709","observation_id":"52f41cde-6d51-477a-8227-b085f3377e8b","resolution":{"observed_at":"2026-08-07T10:47:52.944510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.382943Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.382943Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:d4a60d5ad920648c49a7398da39f380d8a448ff35e38a2f287dd16ab5abeaeca","observation_id":"b92e7245-f15b-45cb-9321-a0f89096591d","resolution":{"observed_at":"2026-08-07T10:47:52.382943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.922197Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":"8e33e236-eb92-4dea-954e-317e5dd83d40","year":2022},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.386209Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:0944937ef8d3b7d9ddcfa5e1365a7a9dd5c3d7f3ecb4e7513253a3ccad32c424","observation_id":"554a1658-05cd-4601-acb8-df04bbf235ba","resolution":{"observed_at":"2026-08-07T10:47:52.926146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.910892Z","title":null,"venue":null,"work_id":"84f8b993-b9f6-4676-9203-0d097892a9b4","year":2017},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.389582Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:d469690f9f96b99fee652e53e65bc2bbb20b1dbb411e0742fa3b44ef52782129","observation_id":"355b3947-cf0e-4319-81d4-6addc5190bc7","resolution":{"observed_at":"2026-08-07T10:47:52.915460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-07T10:47:52.393004Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.arXiv preprint arXiv:2407.08608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.393004Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:4684c0d3032f55bf711712f7190b9b01fc2b08862661aec92f6b3992da219117","observation_id":"1fb8aec3-d7e5-4df1-90f0-490d290303c3","resolution":{"observed_at":"2026-08-07T10:47:52.393004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.900030Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"9248cc97-9eaa-4b18-8624-1f649430fcb1","year":2015},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.396510Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:e1d38eb9fb1f51a097f7ab3485104917d39c46b1535dc49c511ef374834f40ce","observation_id":"89fad71f-44bf-4310-95f9-0b9c313b88aa","resolution":{"observed_at":"2026-08-07T10:47:52.903895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T10:47:52.399540Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.399540Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:d72ff7fe201c79145d7bb6136ebcbf3dcf121f997f820dfff69b5e06dc39e437","observation_id":"c5f9cfbc-9c02-4f1b-8c20-2f944a30cd8f","resolution":{"observed_at":"2026-08-07T10:47:52.399540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T10:47:52.402789Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.402789Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:27778fb9e49c964089d5f781d3a15a2bca85a851eabece0d67e110cf097d07eb","observation_id":"0171e1fb-8e51-470c-b6e7-9692f494d1e2","resolution":{"observed_at":"2026-08-07T10:47:52.402789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-07T01:29:22.842436Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-07T10:47:52.406560Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer.arXiv preprint arXiv:2410.10812, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.406560Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:433f27c08de89c6895cdd0eeb7270bc76f2523ce4f8a1584944092c0d64f35f2","observation_id":"5d10b698-171a-40be-ae4b-daf360f9a221","resolution":{"observed_at":"2026-08-07T10:47:52.406560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01699","last_updated":"2025-03-04T04:33:27Z","snapshot_observed_at":"2026-08-06T12:47:52.616897Z","submitted_at":"2024-10-02T16:05:27Z","title":"Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01699","snapshot_observed_at":"2026-08-07T10:47:52.410568Z","title":"Accelerating auto-regressive text-to-image generation with training-free speculative jacobi decoding.arXiv preprint arXiv:2410.01699, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.410568Z"},"links":{"cited_paper":"/paper/2410.01699","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:7ada364c379d26408a19d12cb6361fa350120bf862198b420e3c6d0078110c09","observation_id":"78279a57-f938-4c6b-93d6-4af035d55e5e","resolution":{"observed_at":"2026-08-07T10:47:52.410568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T10:47:52.414118Z","title":"Visual autoregressive modeling: Scalable image gener- ation via next-scale prediction.arXiv preprint arXiv:2404.02905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.414118Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:b13915ec01034cb353ea8075857c6c8989270d7655476aeb805f09d5c355c437","observation_id":"463b4c9c-7be6-42e4-92f7-8ba3c45b4d01","resolution":{"observed_at":"2026-08-07T10:47:52.414118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.877384Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":"edf19ec1-86a8-4eef-bee1-76d907a9ad78","year":2019},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.421464Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:60e55dedd33c6c7eb27174c66fe7a25e781475e243c83db31aa3b32e261c4d69","observation_id":"b2886779-8ee3-44bd-a24f-120b2d4086bc","resolution":{"observed_at":"2026-08-07T10:47:52.881328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:47:52.424736Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.424736Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:ae8458c98190701266d5d5e8d21f49dd3810851545358bb161884407838f874c","observation_id":"2df60f6c-0518-4f8f-a3ae-9b7f29372a6e","resolution":{"observed_at":"2026-08-07T10:47:52.424736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.866047Z","title":"Pixel recurrent neural networks","venue":null,"work_id":"9bfe7075-e268-4d72-88f0-5d193be1801a","year":2016},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.428038Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:515d31905e78b9b2dd5549f2729650fd7ccd85515accb72e27dcfe23070b9e80","observation_id":"8ca74b77-ba77-4767-8c42-3dca5ac1d48d","resolution":{"observed_at":"2026-08-07T10:47:52.869934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.851898Z","title":"Conditional image generation with pixelcnn decoders, 2016","venue":null,"work_id":"4b0db618-41c4-4fea-9ea1-78ceedd4c693","year":2016},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.431320Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:359c3ba143900f7fba20beff4789e54b91ff208560ac14aa7bbd09b7b9b5ed4a","observation_id":"b540ca1c-26c6-46f1-aa64-09a63eab85be","resolution":{"observed_at":"2026-08-07T10:47:52.856838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.839481Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":"4898571e-f08e-41b9-acae-54e0cb0c7282","year":2018},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.434864Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:d1d216fa0a461218abe43a9fc40c3f98e09046a102431e4e35e7fcfc46e93cc1","observation_id":"d0f9dee2-8169-4620-abb5-aadf75329603","resolution":{"observed_at":"2026-08-07T10:47:52.843521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01819","last_updated":"2025-03-20T12:59:49Z","snapshot_observed_at":"2026-07-06T20:00:28.112838Z","submitted_at":"2024-12-02T18:57:41Z","title":"Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01819","snapshot_observed_at":"2026-08-07T10:47:52.438222Z","title":"Switti: Designing scale-wise transformers for text-to-image synthesis.arXiv preprint arXiv:2412.01819, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.438222Z"},"links":{"cited_paper":"/paper/2412.01819","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:ac18b6612921c2a714a69f0daca920ec5c41aa4ef767c01ad05c6a5fd47ea44e","observation_id":"e7e7c2ba-581a-4394-969e-2172065f66bd","resolution":{"observed_at":"2026-08-07T10:47:52.438222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.826355Z","title":"Maskbit: Embedding-free image generation via bit tokens, 2024","venue":null,"work_id":"b2ff3ec7-9e47-44a5-ad20-a3e73efaf98f","year":2024},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.442068Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:f5380372275b35b97596cdc033b24d182137aa11b0998efc5a2b7d7ebef94628","observation_id":"10ec5dd7-01e4-4816-b0af-55b706fee145","resolution":{"observed_at":"2026-08-07T10:47:52.831826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.813935Z","title":"Scaling autoregressive models for content-rich text-to-image generation,","venue":null,"work_id":"f3252ebb-9452-4b86-9a94-ed9ff69d1353","year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.445424Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:9fc3cf1277db7af8adda33b7a1c87394d866938f5f310a390a8f37a056a39a0d","observation_id":"48aaa2ba-576b-471b-a8b7-65fc00c48146","resolution":{"observed_at":"2026-08-07T10:47:52.818129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01181","last_updated":"2024-08-02T11:03:22Z","snapshot_observed_at":"2026-08-06T13:04:34.380567Z","submitted_at":"2024-08-02T11:03:22Z","title":"VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01181","snapshot_observed_at":"2026-08-07T10:47:52.448909Z","title":"V ar-clip: T ext-to-image generator with vi- sual auto-regressive modeling.arXiv preprint arXiv:2408.01181,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.448909Z"},"links":{"cited_paper":"/paper/2408.01181","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:02aec3887b2938a475eb1a14d0ef1add627cec670c64c631daedf0b2de221769","observation_id":"9cf7b3a0-2484-49d2-a8a1-850297adb6d2","resolution":{"observed_at":"2026-08-07T10:47:52.448909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.803008Z","title":"Extended Related Work 12 B","venue":null,"work_id":"c62163ef-375d-4e80-9f2b-040bbb28b3fc","year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.452510Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:f49923614f30fe9df5b41b726e8ee435b7f3a02c7b322f643a46119722d0165f","observation_id":"7b15bd2c-ac25-46ed-8805-5aeab8b24a71","resolution":{"observed_at":"2026-08-07T10:47:52.806549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.791778Z","title":"However, these models still suffer from quality, efficiency, and flexibility issues","venue":null,"work_id":"bc2f12aa-5230-400c-b45f-1703c3663b92","year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.456480Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:02309ea5e297a2b65f0096c076a9335bae71ebed5295fcc38100172bab8424a7","observation_id":"316291a7-bc2d-4e9d-8725-450465792811","resolution":{"observed_at":"2026-08-07T10:47:52.795665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:47:52.889449Z","title":null,"venue":null,"work_id":"28090296-ec38-4171-97a1-32c4c3398bf3","year":null},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.418165Z"},"links":{"citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:1039a5a51537732c03a70370dba322861a9362fecc3acd96d55d7e192f9cd501","observation_id":"991c8bf4-2a5f-4d26-8fb9-7d70e3cff663","resolution":{"observed_at":"2026-08-07T10:47:52.892882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:40:18.589800Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.04421."}