{"as_of":"2026-08-08T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff5b57fc9fe7344a213d9b29677b305b39531c020d3f9d42414c55a1950048d6","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:27.939105Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:59:53.959732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T05:49:08.291505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-06T10:59:53.959732Z","title":"Native-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-07T21:03:40.851564Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:53.959732Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2507.23268"},"observation_digest":"sha256:5fb473a0eedc956a9809926716a966ac5412de139952b2e211750e487bd8d43f","observation_id":"27e6125d-c332-49bb-83cc-97af61f0e6bc","resolution":{"observed_at":"2026-08-06T10:59:53.959732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-05T10:19:54.506238Z","title":"Native-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-06T05:46:13.034506Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.506238Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:1970f46f24b97fd392ab462e1ec4d067774cc8c1b7dba57835cf1b0c63420958","observation_id":"9359812e-9cde-4758-a93a-988074429599","resolution":{"observed_at":"2026-08-05T10:19:54.506238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2506.03131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native-resolution image synthesis","venue":null,"work_id":"05e39f33-4d2d-4d9e-9904-228f03adc7b2","year":2025},"citing_paper":{"arxiv_id":"2511.19365","last_updated":"2026-04-08T04:08:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T17:59:06Z","title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T05:47:24.669763Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2511.19365"},"observation_digest":"sha256:6c7afaebb2332e9c169b70593fa98e13fef68df4ae3bc83a993a1ed2598949d9","observation_id":"fcc0f4d4-3bec-46a9-afc1-1ea50c3a58ef","resolution":{"observed_at":"2026-05-17T05:49:08.294010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2506.03131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native-resolution image synthesis","venue":null,"work_id":"05e39f33-4d2d-4d9e-9904-228f03adc7b2","year":2025},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:45e0d27bc3acc2e0c0ce5a6c7b6c5f46eee98294accd7b395c991825cd6515e6","observation_id":"cdf67ea2-5bff-46e8-b1f9-b09fb03a980a","resolution":{"observed_at":"2026-05-11T21:51:11.672181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03131","snapshot_observed_at":"2026-08-01T13:38:57.401548Z","title":"Native-resolution image synthesis.arXiv preprint arXiv:2506.03131, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-07T12:25:08.267830Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:38:57.401548Z"},"links":{"cited_paper":"/paper/2506.03131","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:be0d61795358d271db016b0c210292637fff619c47478bd90195437b14efbc8b","observation_id":"de2cb3be-e99b-4213-9930-2e68296213a9","resolution":{"observed_at":"2026-08-01T13:38:57.401548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03131/citation-record","integrity":"/paper/2506.03131/integrity","json":"/paper/2506.03131/citation-record.json","paper":"/paper/2506.03131"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:15:20.987565Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:20.987565Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:bab54fb453f5323ce29ee6ae023e05e8f4a988abdc4de852c0f3daefc992f1da","observation_id":"f161e984-723d-47a5-ad79-9f907838ce09","resolution":{"observed_at":"2026-08-07T11:15:20.987565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-07T11:15:21.066092Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions.arXiv preprint arXiv:2303.08797, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.066092Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5952ff4eba8857f0d9ff042bbf5b90a61124eb2d76deaa9e499968c0244a85c1","observation_id":"2f3135aa-8ffd-44f2-86a9-b3dc8ff00d74","resolution":{"observed_at":"2026-08-07T11:15:21.066092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-07-06T13:58:18.393526Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-07T11:15:21.162998Z","title":"Building normalizing flows with stochastic interpolants","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.162998Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:35f8272b4bf232c55a6cbde61a0fc51066266ec11d1f52322127154a1178a938","observation_id":"25b1c9d2-6bca-4aae-99ae-4fea246ec421","resolution":{"observed_at":"2026-08-07T11:15:21.162998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:15:21.344876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.344876Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:da0672c48c6c5698545259d9fa26c0603ad38465a20d364ecccf69451e70c8ca","observation_id":"0a9ecd36-6c81-4671-bc92-07b176fd83f5","resolution":{"observed_at":"2026-08-07T11:15:21.344876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T11:15:21.483651Z","title":"ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.483651Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0620923fc16d383e704946d50aa7fe1162bcaf27828d2881f2adaf33415c5c63","observation_id":"98f66a24-4a99-4702-b379-d7a5dff555e7","resolution":{"observed_at":"2026-08-07T11:15:21.483651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:21.596345Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.596345Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:224c32f31b6f8765c10da271924e9653d205827a40c336dee1197ea4168f4720","observation_id":"482644b1-f70c-4076-9850-9e8fd82dd5a2","resolution":{"observed_at":"2026-08-07T11:15:21.596345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T11:15:21.740312Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.740312Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7adca159f35d54d85c9f1f3da9ed22edf57602f66d45d1c7bab388293aa68243","observation_id":"36887104-8b08-42f6-9869-9f24112971e3","resolution":{"observed_at":"2026-08-07T11:15:21.740312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:21.900913Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.900913Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f712dcba7e030bd84a6b69f37f76dcdef62d2cec46506c06dda7936c91b7c27a","observation_id":"24041d9d-d77c-4be2-8835-cd52dd56f01a","resolution":{"observed_at":"2026-08-07T11:15:21.900913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16450","last_updated":"2024-03-24T17:14:11Z","snapshot_observed_at":"2026-08-07T01:27:31.196632Z","submitted_at":"2023-10-25T08:13:02Z","title":"CLEX: Continuous Length Extrapolation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16450","snapshot_observed_at":"2026-08-07T11:15:22.062379Z","title":"Clex: Continuous length extrapolation for large language models, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.062379Z"},"links":{"cited_paper":"/paper/2310.16450","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8b241c6f9016e64abf75bf8ab1045f5f4cb14a545ab5de6ef598fd3ce775fbc8","observation_id":"7bd3b75c-c651-403f-9c05-5ed7b935108d","resolution":{"observed_at":"2026-08-07T11:15:22.062379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.223665Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.223665Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:4b79adc6566c8b4d8829b9c5c2fe3772ce80420c088d40cabfcb87f863b6139c","observation_id":"bf88a2d5-a92a-43bc-b731-4b7e242a8bc7","resolution":{"observed_at":"2026-08-07T11:15:22.223665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T11:15:22.301847Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.301847Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5b8fb0cb325ea8c075570159ff76af429b1ed75055c3444e6bdbe09e32eea4e2","observation_id":"cf4dee61-1d22-41b8-974f-d9699b0d446e","resolution":{"observed_at":"2026-08-07T11:15:22.301847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T11:15:22.346398Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models.arXiv preprint arXiv:2410.10733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.346398Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e7fc341f7caec8a4a45855ea828ebd3837587ea50485262a87d9ef5fb9437e24","observation_id":"a12c5aa2-2178-4d83-a23b-245e5e273836","resolution":{"observed_at":"2026-08-07T11:15:22.346398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:15:22.444972Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.444972Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:d8aba1b30227e0cb68a5dce8c517de14ba847704c0987a2ad16534a349a94c29","observation_id":"37a638ae-47dd-4725-b78c-fbb8d9a149ae","resolution":{"observed_at":"2026-08-07T11:15:22.444972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.559084Z","title":"Ramadge, and Alexander Rudnicky","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.559084Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9ac096e4d5e9f5a9fdf7da3f605e168ac06d7b8a27c39132ed20e41fa38da4e0","observation_id":"30a6ae75-d721-4469-978d-ae9d04b7e3c4","resolution":{"observed_at":"2026-08-07T11:15:22.559084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T11:15:22.663379Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning.arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.663379Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0263ff00abcba401e3c9662e0ee4ccf27b69a2ad68f2d895fc0082efe25926dd","observation_id":"4e167c0e-2123-43cc-8301-97552952d1c9","resolution":{"observed_at":"2026-08-07T11:15:22.663379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-07T11:15:22.753088Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution.arXiv preprint arXiv:2307.06304, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.753088Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:be5bdff2075582c7e3577cb728710effedecca0f392b8c5b098d45fe9c4811ad","observation_id":"a0eef25d-31f6-4a4f-ac30-1290f02b085f","resolution":{"observed_at":"2026-08-07T11:15:22.753088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.857667Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.857667Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7b566330d9616169af9ce30c83bccf3b33363cc56b8b6eba5684d2a774c93179","observation_id":"3d12a58b-b8ce-424e-b677-f71b6e6545a2","resolution":{"observed_at":"2026-08-07T11:15:22.857667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:22.952406Z","title":"Diffusion models beat gans on image synthesis.NeurIPS, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.952406Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9de8102d4f36da1008098316a9da5e39ada5d454b051bb1933ec0139d6d7f363","observation_id":"075d9e44-70a8-4a9f-8aed-baa97876e823","resolution":{"observed_at":"2026-08-07T11:15:22.952406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:23.035803Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers.Advances in Neural Information Processing Systems, 35:16890–16902, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.035803Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:267d85f465ccb74c2e40a56fbcea604eb49d07c73c779928988aa2b6de51bc8e","observation_id":"21b77b61-a5a6-43a9-aa68-e0b466eb3bfa","resolution":{"observed_at":"2026-08-07T11:15:23.035803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T11:15:23.081198Z","title":"Longrope: Extending llm context window beyond 2 million tokens.arXiv preprint arXiv:2402.13753, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.081198Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:a9208d497d7178e59bd922acd4ef53a81a468181c8986c1bd5c1fb7a85efad27","observation_id":"7f65b2fc-1edc-4fbf-a366-a0a6211fc287","resolution":{"observed_at":"2026-08-07T11:15:23.081198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:15:23.137904Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.137904Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:81675589073cb3db34c9fcbc71c932dfd318dfa7492d77eb12b4cfcfdf005615","observation_id":"b6634200-3a29-45aa-bf3b-019f36625017","resolution":{"observed_at":"2026-08-07T11:15:23.137904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:15:23.254388Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.254388Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:64b0bf222c29d4a8d44683ff2281f8743546405514407fc8744e6ce4a874a619","observation_id":"9266811a-34a5-4f0d-a98c-7a7c7ff95be3","resolution":{"observed_at":"2026-08-07T11:15:23.254388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.876622Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"304d087f-43bf-416d-94f2-4f3ec44c9118","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.341339Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:49d66307162ce9f59ab6149d7f03542c386b75e2bbb14d79fe9a30e6cebae163","observation_id":"a75da351-980a-499c-96e2-3b060461a921","resolution":{"observed_at":"2026-08-07T11:15:28.880751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.863818Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors","venue":null,"work_id":"6c5b68b7-c5d1-4238-a278-edc76412ac17","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.502549Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8ef3773650f613c8e1e3358a42203f25bcb370fee0e9ce570809d4cf898b138b","observation_id":"2735251d-14fc-475c-b0af-faa2d07ed9c6","resolution":{"observed_at":"2026-08-07T11:15:28.868042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-07-06T15:07:52.629778Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-07T11:15:23.667405Z","title":"Masked diffusion transformer is a strong image synthesizer.arXiv preprint arXiv:2303.14389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.667405Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:dc32b936a1fe635342daaf777d7d281f92c54b44d6dc8fe0d40c0b721c2cd78d","observation_id":"fca8e983-a16a-4156-8cd2-08fe6dec3114","resolution":{"observed_at":"2026-08-07T11:15:23.667405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:15:23.833220Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.833220Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:af997a11f3e223f22982ce389f650705b885c4bc788d449a88d0260a98354e08","observation_id":"690b89dd-e414-4967-ac73-ece6bb013ac7","resolution":{"observed_at":"2026-08-07T11:15:23.833220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-07T16:57:45.872655Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T11:15:23.945547Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models.arXiv preprint arXiv:2308.16137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.945547Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:95b07c6fb99e2f9f55160629b33050301d69f9f068b2da163f981f4070f65a89","observation_id":"59c4f0f8-6bc4-4735-a902-d56b017cf2cc","resolution":{"observed_at":"2026-08-07T11:15:23.945547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.850954Z","title":null,"venue":null,"work_id":"069a56dd-0901-40b8-b889-1e52d2d825c5","year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:23.972830Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:9a2c2acb31388cbbe3f5e03ea4199c030243510a45ae7efb1f63d229d553ceca","observation_id":"97a0a116-776d-47a9-b3eb-f5fb76a55301","resolution":{"observed_at":"2026-08-07T11:15:28.854999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.033223Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.NeurIPS, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.033223Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e18de9b3da8d2358962e0f1a715d1cf9e729c9ac3923dda0e876571eb174eeac","observation_id":"8227c911-c8cc-4169-a446-eaf113c41080","resolution":{"observed_at":"2026-08-07T11:15:24.033223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.115501Z","title":"Denoising diffusion probabilistic models.NeurIPS, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.115501Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:44f6e053f090611b385146b02563f65eead9901f6b098e25d436ea701df1fce6","observation_id":"9e245ee0-ed18-44f3-80af-a4c50841404c","resolution":{"observed_at":"2026-08-07T11:15:24.115501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.821892Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"dab0ee16-d7b4-4358-98a3-e88b78cec0af","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.240951Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6749650699f33da0cf5429c6ceb247903e85ad063a750e18461ad4e824e9cb4e","observation_id":"cd4ca75d-a2af-4e68-a9ec-0461fbeceaa5","resolution":{"observed_at":"2026-08-07T11:15:28.826312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.809053Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":"22d1a348-9ba4-444d-9806-c01e34e9fea3","year":2005},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.313090Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c18db5f3a951d646a126872504886d9e263e861e1aeb1ef39bca649a048a9976","observation_id":"24e79e3f-64d7-4472-a757-c37db8b6d5c8","resolution":{"observed_at":"2026-08-07T11:15:28.813464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.796709Z","title":"Springer Science & Business Media, 2005","venue":null,"work_id":"f7344e51-6a73-4e3e-9d02-b3cb0378b695","year":2005},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.402250Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:0334b9e5924ffb36238de7703a99e1b7a31806d5fe0bd94c2b5a20890f2296bd","observation_id":"d7feca47-4f14-4ee1-8e51-1838f68d4963","resolution":{"observed_at":"2026-08-07T11:15:28.800801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:15:24.469159Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.469159Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:01e3a0eddc90d2216b4a04ac6126ebb5cadf237c875e9086ceaa945c40a8b62d","observation_id":"f8eb2c10-6433-47ed-9611-8d1e20dcf930","resolution":{"observed_at":"2026-08-07T11:15:24.469159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.783909Z","title":"Elucidating the design space of diffusion-based generative models.NeurIPS, 2022","venue":null,"work_id":"6a5dc1af-5cb0-4097-96a0-c782eb2bed82","year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.558757Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:bc6a55f2ffaf0e3e913f6fb6bb7f17b2398f2e4786206ac36209a53aa64a39c7","observation_id":"e89498af-fbf2-4efd-9657-89d87486a412","resolution":{"observed_at":"2026-08-07T11:15:28.788083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.651388Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.651388Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:212f41fa2ed5a62dba178ae435297ec6969a98e1c62d28be30b8146a5d618440","observation_id":"0cdcc470-883f-4204-a57c-48b908bba491","resolution":{"observed_at":"2026-08-07T11:15:24.651388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.746027Z","title":"The impact of positional encoding on length generalization in transformers.Advances in Neural Information Processing Systems, 36:24892–24928, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.746027Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:ee4a1dcfa51478e3c33c87df373c4e1775cb8044220948d9e4a2539ad0450def","observation_id":"40cc2cb7-e7c6-486d-a911-b22ce04c4bfc","resolution":{"observed_at":"2026-08-07T11:15:24.746027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:24.811862Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.811862Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6ebea1df04dee463f03ed3c1a383dcf90cba27b5b3af90f55fdac76cce168410","observation_id":"3093cf34-c5da-4be4-8bc6-d61fc33f4068","resolution":{"observed_at":"2026-08-07T11:15:24.811862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-06T06:13:52.132620Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-07T11:15:24.901809Z","title":"Efficient sequence packing without cross-contamination: Accelerating large language models without impacting performance.arXiv preprint arXiv:2107.02027, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.901809Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e3a37f8a9b5084f90f406fd8966ac6c9fc04f3e931e357b64d547c9a55fcedd9","observation_id":"14fe30ba-120e-49c9-858d-5e0e414a31ad","resolution":{"observed_at":"2026-08-07T11:15:24.901809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.748368Z","title":"Kynkäänniemi, T","venue":null,"work_id":"1c0dfadb-7388-47c9-bdf4-27b3793d29f1","year":2019},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:24.993696Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:854e3ab7fa8c6059121a51e96b6c610810ce67ee15a141440615ebce70d6f515","observation_id":"59142b54-efb8-48f4-b716-dd3ad09df58a","resolution":{"observed_at":"2026-08-07T11:15:28.752721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.083512Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.083512Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:cf86236e094352f1bd3ba1e59bbc0e70871e6040374ecb1dc3f592c6af7264b8","observation_id":"d0934f07-f05c-41d8-ae65-faedd23d444a","resolution":{"observed_at":"2026-08-07T11:15:25.083512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T11:15:25.150326Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.150326Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f0ea1e6a0c579dcd2b716ff0343bf71737ac3a2dcfc97f81c580255fc25fe234","observation_id":"56bab1c0-cbb0-42d6-89b9-beea2051c08e","resolution":{"observed_at":"2026-08-07T11:15:25.150326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:15:25.242734Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.242734Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:1957227dd548fa72cee3eb9a15e317d55f48c11463a4b61f2610ff12e02ac5f8","observation_id":"7f2c05bc-dbca-441d-ad90-ed26bc2b99c3","resolution":{"observed_at":"2026-08-07T11:15:25.242734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.343513Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.343513Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:12a7cf094c44ae7d84ed87ff0c88cdb614b433b22dc316870e99895a03e3b467","observation_id":"8eb9cfa1-38f8-4c25-92cd-1445e60c001e","resolution":{"observed_at":"2026-08-07T11:15:25.343513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.720728Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size with- out any fine-tuning and minimal perplexity degradation","venue":null,"work_id":"fb3c1b34-90eb-406f-ae71-d13b04607e87","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.437263Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:afe0a03867f8a4d8619cb8b792d097be1609cca11dc29d06180230b4d281d6b2","observation_id":"737abe9f-7f54-4bd9-9676-6e4f7176a03c","resolution":{"observed_at":"2026-08-07T11:15:28.724807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.708332Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"0aa2bace-5e1c-481d-ab92-b6bd899f3879","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.532035Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b22eb063dd407a91c73e4ea3ad564eab116ec9d6ac154aa2d564aed63ee4f152","observation_id":"1949db0f-b8ea-4485-9e50-8ad4295c7220","resolution":{"observed_at":"2026-08-07T11:15:28.712428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-07T23:50:09.060564Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-07T11:15:25.626014Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers.arXiv preprint arXiv:2401.08740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.626014Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:fa1b6724d9260314557ed171cddebaeeac546851d2804660ffe6980613cff41d","observation_id":"9c7ee035-06ae-454e-b0ec-dc99ee5045b9","resolution":{"observed_at":"2026-08-07T11:15:25.626014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-07-06T11:34:54.333802Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-07T11:15:25.685719Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations.arXiv preprint arXiv:2108.01073, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.685719Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7301b3f5ce70c93830823f75ba6ea378d27e9ac31e495ebbf81bbc8fa20b0770","observation_id":"7d6d7170-d0b0-4583-97be-6fb4415c56dc","resolution":{"observed_at":"2026-08-07T11:15:25.685719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:25.754276Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, april 2025, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.754276Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c47ee6c2c93962d4931ef200ce76006bdcf77715248e6a9c1e45be987cd2f77d","observation_id":"9924311c-de1d-4408-8f2f-f291691e1ec4","resolution":{"observed_at":"2026-08-07T11:15:25.754276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03841","last_updated":"2021-03-05T17:56:03Z","snapshot_observed_at":"2026-08-05T23:24:04.690967Z","submitted_at":"2021-03-05T17:56:03Z","title":"Generating Images with Sparse Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03841","snapshot_observed_at":"2026-08-07T11:15:25.847259Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.847259Z"},"links":{"cited_paper":"/paper/2103.03841","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5f5d267e619583dba94a9c87cbb9285f77a4c06cdbc2d40010000ea46ea21420","observation_id":"176abfe9-1a39-4f1a-9b10-41cea373b490","resolution":{"observed_at":"2026-08-07T11:15:25.847259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T11:15:25.908440Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:25.908440Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b35bb5b39f887274435385b1b90c5060b680da2d8de42375d7fd554b04c3710b","observation_id":"50145533-0526-4762-8c89-8f8e77d0c46b","resolution":{"observed_at":"2026-08-07T11:15:25.908440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:26.003489Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.003489Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:3fe3143ed0893b2d584fe69ba56c5566596db33c34d49c366a3b2d68d076b193","observation_id":"1be92052-8696-4bc8-bb13-94b934de05ee","resolution":{"observed_at":"2026-08-07T11:15:26.003489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.680344Z","title":"Pearson Educación, 1997","venue":null,"work_id":"429603d0-49e1-4caa-9e41-ee723aadae91","year":1997},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.101969Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:a43314d81f7b3c1adea0b54dd7902b7300c9e2b5f862c8efcdfc58cb030c11f2","observation_id":"ee5d10d4-65d7-47d6-8d57-c7b7d402f663","resolution":{"observed_at":"2026-08-07T11:15:28.684253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T11:15:26.216276Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.216276Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:75b72d7144c7f685c5141db112678effc18f7641b14ad28cb7796a1cc2dc8db9","observation_id":"dac0b850-91bb-4a63-ae5b-d2a21564678b","resolution":{"observed_at":"2026-08-07T11:15:26.216276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:26.240491Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.240491Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f229bb950ef67e3499044d1d7def8aa5e96caeac7bc3860c3c4d709486de2795","observation_id":"e035af05-5512-49fd-9f08-8178163eca4f","resolution":{"observed_at":"2026-08-07T11:15:26.240491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T11:15:26.393194Z","title":"Yarn: Efficient context window extension of large language models.arXiv preprint arXiv:2309.00071, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.393194Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:3867763ab9cb503ebf7203624a0af5acd1473c309cc337c5c20d2768a55c056f","observation_id":"c6229fcc-5086-40ef-b099-856cb9f7ca87","resolution":{"observed_at":"2026-08-07T11:15:26.393194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T11:15:26.611490Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.611490Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:cb01decce029a2b65e62990133fd857515e98797ba6c47b1a91a9d68f1f32c93","observation_id":"316110c1-aa34-4e6a-be20-971ffabbd9d2","resolution":{"observed_at":"2026-08-07T11:15:26.611490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.659928Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"c859df9e-1a91-4a60-b68c-623eaadf72bd","year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.733572Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:903d6867c98d21790d2f9f92912a2010914bf10ddd8a9f6e6de0ad56fc8058a5","observation_id":"5eb6cec8-4910-4f10-9042-b9a2d792f6e9","resolution":{"observed_at":"2026-08-07T11:15:28.664013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T11:15:26.885811Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:26.885811Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6fd1462aae8fd25982487a2916c5fc87cbbfb57e18d2292cc14295008a7b97ac","observation_id":"5a6bdc94-a183-4f9d-bf8a-d1d796de94ed","resolution":{"observed_at":"2026-08-07T11:15:26.885811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.647414Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"c6d61db9-de3a-4268-a745-574f74dc1908","year":2021},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.054517Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:59ec935c2df7586456671135c6664835e489d6c2c051b2d6d3fad641671dabf0","observation_id":"8ffbd902-cd6a-4e03-a83b-f6f1c0ac3e0c","resolution":{"observed_at":"2026-08-07T11:15:28.651576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.070558Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.070558Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8feb64fd893bfa3af8e1f24c4f71b1dee25ade8892d93e5e8a0d5c807d7f97e6","observation_id":"0bd08008-c6e1-48c2-b0be-83378756de88","resolution":{"observed_at":"2026-08-07T11:15:27.070558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.627842Z","title":"Salimans, I","venue":null,"work_id":"d0eab0e6-d5ac-4338-ae1e-3523837845fe","year":2016},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.151937Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:4f23b349d3f019584e7af9ab57619db9174519a770b0d64d6651bd402b9a379e","observation_id":"c56deb2a-9f32-42ed-9608-37e81cf4df64","resolution":{"observed_at":"2026-08-07T11:15:28.631694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.248286Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.248286Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b7c7d6b083741e6676ff23c8e510b0d377babf97c2c70bb55db4314290fe66be","observation_id":"44ae72e7-1e62-4d6c-aeed-948c21a8ffa2","resolution":{"observed_at":"2026-08-07T11:15:27.248286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.252346Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.252346Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7d528983d6258b0449d0d424c4d3b5a03391cd2e2e68d317db0a7c926568e0d4","observation_id":"2578c484-905e-4f72-8bfa-528f3bc0bc88","resolution":{"observed_at":"2026-08-07T11:15:27.252346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.280745Z","title":"Improved techniques for training score-based generative models.NeurIPS, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.280745Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6872170b5d9991e06cb3ebc9d5438e91fa2541ecfc1c40df514771cfb203a4fc","observation_id":"0f6a762a-4f27-4862-8e9c-0f80710cc57a","resolution":{"observed_at":"2026-08-07T11:15:27.280745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T11:15:27.370087Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.370087Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:37f4ecd27c68713b17d8abb8581837cda1e20e5facca82cb5cdae951559b43ca","observation_id":"9fc7b962-7f85-4147-aac0-8b289c67f08d","resolution":{"observed_at":"2026-08-07T11:15:27.370087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:28.590761Z","title":"Springer, 2013","venue":null,"work_id":"85f79e57-d9aa-4948-bc1c-d18e4907f2c1","year":2013},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.447708Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:7d44c06d3cb59b626cda5699148226c40df5449062307a92a670641f3eb6201a","observation_id":"a50211fc-31df-4d42-880a-43456de3815d","resolution":{"observed_at":"2026-08-07T11:15:28.594798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.526473Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.526473Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:265bf2e97ed02584df80527d94ee342e83f764b9e216c5811956f550d70deb6a","observation_id":"89af2ae6-5db2-4524-b0e6-10fc1ffcdc73","resolution":{"observed_at":"2026-08-07T11:15:27.526473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T11:15:27.613456Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.613456Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5b2d7fc78a9fd7b8d779879b4ee099172437471b81f3e06add17533a38f357b7","observation_id":"8a5d7fff-8a42-40cb-957c-aa7367634621","resolution":{"observed_at":"2026-08-07T11:15:27.613456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T11:15:27.691230Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.691230Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:388c6228a484384de25a2bb77a57844392846dfdec403ed5892bba7b35a61f0e","observation_id":"b8dae6e2-b953-4ce0-8233-84253194770e","resolution":{"observed_at":"2026-08-07T11:15:27.691230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:15:27.762445Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.762445Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6f8a12fbaedf66689eedbafe2fb8d2434603b8e87bbc7518694dd0b5d46f179f","observation_id":"4f4b7648-4cc5-42d5-9820-a4a588dfc9c6","resolution":{"observed_at":"2026-08-07T11:15:27.762445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T11:15:27.846475Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.846475Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5816db45ce4ce05c66883314e4ebb9f599c7bc0f4e17b23307c37a6f3843a1e0","observation_id":"983512aa-42be-4090-a934-f5d5f5aa5f3f","resolution":{"observed_at":"2026-08-07T11:15:27.846475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:15:27.879113Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.879113Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6bf0ac9ab079d6dc86861316e1d10348146f3de75f6086c4ce877056b43db98d","observation_id":"c2b9a487-b8ab-48e9-9476-b94bf5e51ded","resolution":{"observed_at":"2026-08-07T11:15:27.879113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:15:27.883333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.883333Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:6e23a919ff0f1926463be2e735a0c8250221d91ac482c34101e49fb53a0a8b8d","observation_id":"ca6ce34a-977b-44cb-b5e1-2db8299ff808","resolution":{"observed_at":"2026-08-07T11:15:27.883333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T11:15:27.894108Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.894108Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c67d95e63c9dd441f14dff7159e11c985f7f44b89d0849de3aa69655577e8093","observation_id":"ddef2aa0-1b0b-4acd-b6ca-d818d7237e27","resolution":{"observed_at":"2026-08-07T11:15:27.894108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:27.897881Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.897881Z"},"links":{"citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:93cf21f6173edebf1d9244dd000183562e71633ffe5f215e39b53121072ec6ed","observation_id":"bf6fd23a-01d3-413b-a43b-f0cfa40d0d82","resolution":{"observed_at":"2026-08-07T11:15:27.897881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:15:27.901577Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.901577Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:a62e35dcc2e4247af796cb0d4ffe78645616bbcc54dcf14932deaed92bc8022e","observation_id":"2717444f-37c8-4a18-b2ae-3112867016f3","resolution":{"observed_at":"2026-08-07T11:15:27.901577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:15:27.905511Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.905511Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:e0fe0f96b0932a67d240746b5cc09ea3bd7c96976b12882365595cc8db85b321","observation_id":"8d8f8cfe-f9e0-4bdd-8cae-ecbeeee76172","resolution":{"observed_at":"2026-08-07T11:15:27.905511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22655","last_updated":"2024-10-30T02:48:50Z","snapshot_observed_at":"2026-07-06T19:41:59.246720Z","submitted_at":"2024-10-30T02:48:50Z","title":"FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution","version":1},"cited_work":{"arxiv_id":"2410.22655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22655","snapshot_observed_at":"2026-08-07T11:15:28.069883Z","title":"FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution","venue":"cs.CV","work_id":"4f50d9f9-9d16-43ca-a374-f7f1c2cb691d","year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.909683Z"},"links":{"cited_paper":"/paper/2410.22655","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:b3c6ea622feed45d74971b5787762e746e63cb395983955558361e63a94bde56","observation_id":"bf02c922-3487-4c70-8f08-d8fbfc4217d2","resolution":{"observed_at":"2026-08-07T11:15:28.075956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13925","last_updated":"2024-10-17T15:51:49Z","snapshot_observed_at":"2026-07-06T19:35:35.229351Z","submitted_at":"2024-10-17T15:51:49Z","title":"FiTv2: Scalable and Improved Flexible Vision Transformer for Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13925","snapshot_observed_at":"2026-08-07T11:15:27.913353Z","title":"Fitv2: Scalable and improved flexible vision transformer for diffusion model.arXiv preprint arXiv:2410.13925, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.913353Z"},"links":{"cited_paper":"/paper/2410.13925","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:67a4de14919d3920ca991040ce460ff189b67ee52792e4607096e6e38412a4a6","observation_id":"835a150f-1d8a-44a9-8172-b9ec0f5a1bc0","resolution":{"observed_at":"2026-08-07T11:15:27.913353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T11:15:27.917023Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.917023Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:5a794ace616933bee01f906a78af0a7024ba712b7df345c1d7eff526baac817a","observation_id":"b84bce03-8b41-4f15-861f-92659f6b1a16","resolution":{"observed_at":"2026-08-07T11:15:27.917023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:15:27.920953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.920953Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:8ecfb795a5d654b9ac95c64fb0c710d99b947b510b1bb8b0f5408906cdd7ae97","observation_id":"9d157082-e74f-4f26-9d4f-e2affd1a205a","resolution":{"observed_at":"2026-08-07T11:15:27.920953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:15:27.924274Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.924274Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:f5c80ac7f32ad81d6d83d6bc685e74d4c57261fadec94da9a131477e3882bcdd","observation_id":"d4e4bee8-5a77-40fe-8ac7-355eaf138879","resolution":{"observed_at":"2026-08-07T11:15:27.924274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:15:27.927710Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.927710Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:edbe2e4cf255a1d263604b4bdb09b3b34d1c1951757c2f71405983f83975fe19","observation_id":"0947f8ca-f047-4568-9340-f074930b1d8f","resolution":{"observed_at":"2026-08-07T11:15:27.927710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:15:27.931555Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.931555Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:3982f945b109ca4f615eb0f00bb96ef72ae650c1ccf5572ace608e5b217fef77","observation_id":"aa682b6b-9d61-4183-9d58-2f8001db09e3","resolution":{"observed_at":"2026-08-07T11:15:27.931555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T11:15:27.935094Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.935094Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:525a69baa8cb182f4193ac3d61da1bde23a90505bf01f18c842012d957144350","observation_id":"96980f9b-1acf-47de-821d-41f3b86bbe48","resolution":{"observed_at":"2026-08-07T11:15:27.935094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10400","last_updated":"2024-02-21T13:37:07Z","snapshot_observed_at":"2026-08-02T07:16:04.509348Z","submitted_at":"2023-09-19T08:03:38Z","title":"PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10400","snapshot_observed_at":"2026-08-07T11:15:27.939105Z","title":"Pose: Efficient context window extension of llms via positional skip-wise training.arXiv preprint arXiv:2309.10400, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.939105Z"},"links":{"cited_paper":"/paper/2309.10400","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c8b3448d7a57c4c1da1c45aa8d73f7cd74a9c16f92f01c833c7dc0967dc2f27f","observation_id":"cb2c27da-bdac-40a4-9dc7-a7ede0d331e0","resolution":{"observed_at":"2026-08-07T11:15:27.939105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 5 inbound Pith citation observations for arXiv:2506.03131."}