{"as_of":"2026-08-23T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c922c8b1fd70fce4315e916fcc7a51b40974bb596e11a01b6f999ffb01c0e515","coverage":[{"denominator":136,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:21:30.601457Z","state":"measured"},{"denominator":110,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":110,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:34:11.795076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:28:32.067048Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-07T12:34:11.795076Z","title":"Y ., Pan, J., Wu, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24406","last_updated":"2025-05-30T09:45:41Z","snapshot_observed_at":"2026-08-15T23:52:50.289846Z","submitted_at":"2025-05-30T09:45:41Z","title":"IRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:11.795076Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2505.24406"},"observation_digest":"sha256:f82628d08036eb72b64a03bb1f64cf82c8efa1214653073374724ba5a7ead90e","observation_id":"03ed1463-9d7e-49f5-bd31-d818ef5b29e3","resolution":{"observed_at":"2026-08-07T12:34:11.795076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-06T23:01:49.815176Z","title":"Discrete visual tokens of autoregression, by diffusion, and for reasoning.arXiv preprint arXiv:2505.07538, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.815176Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:7e144d7409e0c063dbe7e5775147d79eded9070e32130e2fddd236fc4554c219","observation_id":"5a97a6a8-26bc-4f56-9a80-f7f0ead67f4b","resolution":{"observed_at":"2026-08-06T23:01:49.815176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-05T21:53:31.402367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07878","last_updated":"2025-08-11T11:51:06Z","snapshot_observed_at":"2026-08-17T14:12:28.672914Z","submitted_at":"2025-08-11T11:51:06Z","title":"TAP: Parameter-efficient Task-Aware Prompting for Adverse Weather Removal","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:31.402367Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2508.07878"},"observation_digest":"sha256:78c6446d2ca61548a0c7ad6d6ea3be5d2d919f13a92ad65de7f2c668e48f6d65","observation_id":"37013941-5f88-47bf-bfa3-6ab407143bea","resolution":{"observed_at":"2026-08-05T21:53:31.402367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2604.15453","last_updated":"2026-04-16T18:13:48Z","snapshot_observed_at":"2026-08-21T04:57:15.393255Z","submitted_at":"2026-04-16T18:13:48Z","title":"(1D) Ordered Tokens Enable Efficient Test-Time Search","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T11:07:42.245810Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2604.15453"},"observation_digest":"sha256:1ce190ee10fdc7927307cd251bd9eb74531f14209d6957de8680de3f5e87ea6c","observation_id":"264d98ea-86c3-49f9-a435-05e7ea5f30e3","resolution":{"observed_at":"2026-05-10T11:10:08.999719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T13:52:42.834440Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:e631481cd2062252b7dd1de554b050980a07a1e99c171626648aa128a3b75ba8","observation_id":"bea56d38-c42d-462f-8a86-8972860f0c02","resolution":{"observed_at":"2026-05-11T18:51:06.077496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T23:36:51.148162Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:b88aba6975e241bc96c4a2c998e3e867c7c7be620960db63cc029d579f05aa28","observation_id":"a17bca25-1c3b-4e72-a6e5-dc9db4f3ed48","resolution":{"observed_at":"2026-07-01T13:15:46.140171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-12T18:02:55.540174Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:1c8902149ee8920e05f868700416cacd6db16ce661fdf106425f407b65cfbe5a","observation_id":"4cb9248f-9406-4295-ad51-3e7438e6479f","resolution":{"observed_at":"2026-07-03T14:28:32.068307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":"2505.07538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-07-03T14:28:32.067048Z","title":"Selftok: Discrete visual tokens of autoregression, by diffusion, and for reasoning","venue":null,"work_id":"721b5fec-f82b-4d07-9c23-852bd1b2838a","year":2025},"citing_paper":{"arxiv_id":"2606.30248","last_updated":"2026-07-15T11:35:26Z","snapshot_observed_at":"2026-08-08T09:25:46.128175Z","submitted_at":"2026-06-29T12:57:34Z","title":"Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:44.343539Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2606.30248"},"observation_digest":"sha256:ce977518d3cfa43dab688662dcef7d33a17709f1f37cfede43139cbc8ebee0a2","observation_id":"0e76332c-b599-451e-b719-87cdbef12fb5","resolution":{"observed_at":"2026-06-30T08:14:26.769263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-02T09:37:23.456229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30248","last_updated":"2026-07-15T11:35:26Z","snapshot_observed_at":"2026-08-08T09:25:46.128175Z","submitted_at":"2026-06-29T12:57:34Z","title":"Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T09:37:23.456229Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2606.30248"},"observation_digest":"sha256:8726581e93434e001796bcec60ccb9d63748b24ec267f54b8002df965eff4c0b","observation_id":"7d076275-a792-43b0-b30f-23238cb1ce66","resolution":{"observed_at":"2026-08-02T09:37:23.456229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07538","snapshot_observed_at":"2026-08-01T04:29:51.713110Z","title":"arXiv preprint arXiv:2505.07538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-20T18:36:09.838665Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T04:29:51.713110Z"},"links":{"cited_paper":"/paper/2505.07538","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:6b5c02bfeffdb49d190eda5606bbe90579091d85114494a28cd1b78b45e3f8e7","observation_id":"2f0020f5-58c2-4cf9-9e0e-596ba65d3cd1","resolution":{"observed_at":"2026-08-01T04:29:51.713110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07538/citation-record","integrity":"/paper/2505.07538/integrity","json":"/paper/2505.07538/citation-record.json","paper":"/paper/2505.07538"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-15T22:21:30.209938Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.209938Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:e3d3525e5c9750506a78bb66a1a85a029bebeb632bf3dfdc4d9adf1ecb319b17","observation_id":"853fae54-055d-4765-9ddd-2781eec2210b","resolution":{"observed_at":"2026-08-15T22:21:30.209938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.215030Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.215030Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:6e0123ddb3e6567931c5d5a862b941e1d9d79c0f6c47c2d0d5286c8f6c8d16d0","observation_id":"eabafcd6-b845-4f1c-a6ac-6b2586ac66b6","resolution":{"observed_at":"2026-08-15T22:21:30.215030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.218978Z","title":"Cogview4: Next-generation image creation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.218978Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:659491119aa7a6cd6c4ee92c953a384c42cb24cee4a7709d4dd740965ef50093","observation_id":"3917c776-d4a0-42a9-a912-8f28d7a203ab","resolution":{"observed_at":"2026-08-15T22:21:30.218978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13967","last_updated":"2025-06-04T12:56:23Z","snapshot_observed_at":"2026-08-18T14:38:59.557403Z","submitted_at":"2025-02-19T18:59:44Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13967","snapshot_observed_at":"2026-08-15T22:21:30.222903Z","title":"Flextok: Resampling images into 1d token sequences of flexible length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.222903Z"},"links":{"cited_paper":"/paper/2502.13967","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f5ebf9d53cb0259f9d9770e3000bfdbbbfebb00e73b857be71e144a599405811","observation_id":"0757000c-989f-48a4-92ce-05ab452a7c3c","resolution":{"observed_at":"2026-08-15T22:21:30.222903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T22:21:30.227428Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.227428Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:c537444fb76bacaf14651f6eeb934bc8282780283b8dd19bda33a3214112928a","observation_id":"a7a9f234-dc8a-4e09-bfe3-d6380bdfb96d","resolution":{"observed_at":"2026-08-15T22:21:30.227428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.233552Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.233552Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:fc7295ea1cedcc256cf0f7d27760dd480924fcebe914b139c2484f79feeb063b","observation_id":"02dc6327-1738-45aa-8000-18c07da86843","resolution":{"observed_at":"2026-08-15T22:21:30.233552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.238141Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.238141Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5e19985ee4eaf8466f2e521f12ccfc426405516542d7d7bfac8b92679e8020f0","observation_id":"d662ea7e-8b52-448a-b85b-7dce66cfc2ce","resolution":{"observed_at":"2026-08-15T22:21:30.238141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.241982Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.241982Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:11a2333b881bd73ebe66aa727f9d0cf0f2aa35bf7b2f52ef4122f2ae97cf5612","observation_id":"3a6dd38f-3567-469d-a2a0-9842c5cbae80","resolution":{"observed_at":"2026-08-15T22:21:30.241982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-16T16:04:52.013149Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-15T22:21:30.245880Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.245880Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:9644862d46dbe8467eb91fc4b18563b9014f2832048bf15c45b7c85cbc9bee93","observation_id":"db27d10d-1d20-424a-bbac-e9512bcdb96c","resolution":{"observed_at":"2026-08-15T22:21:30.245880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-15T22:21:30.250126Z","title":"Pixart-𝛼: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.250126Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:73d920f907f1b58ba9e2e229d4bf95ec5f301a6e865bc9f0ec2d5ffd756dd3f1","observation_id":"e4e1cf9f-d723-45d4-9d4b-0ded1375c65e","resolution":{"observed_at":"2026-08-15T22:21:30.250126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-16T03:32:25.570081Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-15T22:21:30.254395Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.254395Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:e9e8ac30cac700e20c81e1fadfffc229e2ee0b24787f04ee25c1142f77f32388","observation_id":"ff94986d-04fa-41b5-8edc-3dc52c7149f4","resolution":{"observed_at":"2026-08-15T22:21:30.254395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-15T22:21:30.258422Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.258422Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:d696c3efdc6b2777b6a9cdd3348f09ab169d316d2bc27a71bdef743d55bc542a","observation_id":"6e112dd2-b128-4dd6-8559-be9a6765b12e","resolution":{"observed_at":"2026-08-15T22:21:30.258422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-21T20:37:42.923128Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-15T22:21:30.262430Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.262430Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:3d34f540dfb980380de3bc0093352ac95a4edb106f1aac2507e98979c7a52c74","observation_id":"0c411dfa-871c-416a-bd1c-e7ceac585b17","resolution":{"observed_at":"2026-08-15T22:21:30.262430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.266348Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.266348Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:21049cbe399aa32ea6eccb5b1d7e6f98c3eefa569426f4deba07fb5d387935e6","observation_id":"d1b170c0-a401-4549-80ca-c1a75d75dc7f","resolution":{"observed_at":"2026-08-15T22:21:30.266348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.270022Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.270022Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:98138aa179664d684caecd16ca22802e516aa83c4f8a4ee8a00f83aaacbfe1f3","observation_id":"a2fc0355-1853-434a-9b94-3571188d362d","resolution":{"observed_at":"2026-08-15T22:21:30.270022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-08-18T10:40:40.596551Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-15T22:21:30.273912Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.273912Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:b1f8aafb197e8598b6653a98e88b85b3b2b222a94ee026f8970a9bd6e134ca17","observation_id":"991e4d41-d404-46ac-88af-909d179c1477","resolution":{"observed_at":"2026-08-15T22:21:30.273912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.277996Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.277996Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:329137f28e58f243a5f1e4ce16478b41f126289cc5b4cfc8817cad636926a5cb","observation_id":"29020a1a-e7cb-47ec-9512-81f5351c1ebd","resolution":{"observed_at":"2026-08-15T22:21:30.277996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-15T22:21:30.281682Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.281682Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:7d037d97200ac3ccaca8736babd6109c9b17ee12cdde2142b59b286aac4ef2a7","observation_id":"b07c87a6-8e2d-4c32-9d26-f3a4a23ca481","resolution":{"observed_at":"2026-08-15T22:21:30.281682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.285769Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.285769Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f9c49e904239c6468b39317f97f7c1926947bd2ec6833ab7c95ae0c9c4cc8ef9","observation_id":"9c650bda-b151-4f03-91cc-27e349ad988a","resolution":{"observed_at":"2026-08-15T22:21:30.285769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.289301Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.289301Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:50f224bc190d5b3d7738e02f779d438a2653ee808d2d2e56f56be3cb28541adc","observation_id":"e33bdd08-ad5a-430d-9ce4-8e014621962d","resolution":{"observed_at":"2026-08-15T22:21:30.289301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-15T22:21:30.293327Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.293327Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:1cfe0bba228011bf1a2c5e1be6948661b0e7d352d9ce7693a6f046acd3513614","observation_id":"a994d005-c83a-4597-b7e5-2cf6bbafc688","resolution":{"observed_at":"2026-08-15T22:21:30.293327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.297617Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.297617Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:18a7c79f5bffdff6c5a22adc087f57307dc7ed58856842c7910ab6b31a09d9d4","observation_id":"ccec577d-8cd8-4e0d-a320-db7caa8647fa","resolution":{"observed_at":"2026-08-15T22:21:30.297617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.301732Z","title":"Adaptive length image tokenization via recurrent allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.301732Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:fd6764955d9ba46d007c8ed0f4d181d7bc14c6c8a333a5752c37ea68f368e8c1","observation_id":"62a9d35e-df87-4935-9485-09363b4645a4","resolution":{"observed_at":"2026-08-15T22:21:30.301732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.305635Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.305635Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:ebac88cfead7496bb5f94d01a6e10c36a185e75f71e32821d89ea0c1bbd4554d","observation_id":"80b3b58f-f02d-4e1b-9591-9e0af6ebb812","resolution":{"observed_at":"2026-08-15T22:21:30.305635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.309602Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.309602Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:c9786d5a5382f31a7e8e008688bcff96ad1b3f207c1039b7712207ea0a6485a3","observation_id":"76fee686-1e78-43b2-8562-e6b77d14173c","resolution":{"observed_at":"2026-08-15T22:21:30.309602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-19T15:05:47.640222Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-15T22:21:30.313407Z","title":"Guiding instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.313407Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:1180e76c5a69db570f28533060cfd4181f15352d71fe005f5e91a6b2fc236533","observation_id":"8427b3ff-1693-4cd0-9532-d975ee6f87e1","resolution":{"observed_at":"2026-08-15T22:21:30.313407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-08-21T15:23:53.574722Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-15T22:21:30.317518Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.317518Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:29c69b8becf5983d81a998ab2affcf233c4bdaa98363f89713b7ee53535c07e3","observation_id":"13386499-bd3b-45c4-a6cd-e137f993a7f3","resolution":{"observed_at":"2026-08-15T22:21:30.317518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.321605Z","title":"Seedream 3.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.321605Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:3fb1f96e800218518a6586042ed133eca1f8dd5186a5afc079ad120cd60f2d06","observation_id":"18889c96-6f47-42c4-a1d7-b7a226c56420","resolution":{"observed_at":"2026-08-15T22:21:30.321605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-15T22:21:30.325285Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.325285Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:058660e827a3d9b90194f4b785bfcd0068e23a124e695f6d9e5ee18c694a367d","observation_id":"6de8d79b-1cb1-42e6-9823-7387d02c7d23","resolution":{"observed_at":"2026-08-15T22:21:30.325285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.329926Z","title":"Instructdiffusion: A generalist modeling interface for vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.329926Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:6d5e9d6b75a4f13984986d6ad264edd265a50a4531f4e555de5ec6cd4ce31075","observation_id":"27d72071-fbb4-48e4-b8a8-924177433665","resolution":{"observed_at":"2026-08-15T22:21:30.329926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.334048Z","title":"Geneval: An object-focused framework for evaluating text-to- image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.334048Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:032d96bfb7baa59b495f6f1dd8658e18f9592058e8fee2274f1a9eee601a22bb","observation_id":"600b3329-c4b2-4fbc-ba4c-2ca452c5d1e7","resolution":{"observed_at":"2026-08-15T22:21:30.334048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-16T23:36:44.216328Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-15T22:21:30.337753Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.337753Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:6052bad69d4ef9f87945d0026c86809caf1b8578afec3b915152670a423271e1","observation_id":"3e243bff-ef66-456c-bd6b-da1ab8b5c2ce","resolution":{"observed_at":"2026-08-15T22:21:30.337753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.341665Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.341665Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:3409cd7130fb8b2a37561711dcbc8d4661780a788a190d228278597cc6d50b2c","observation_id":"779507a9-4a73-46bd-8717-fdedb66aee14","resolution":{"observed_at":"2026-08-15T22:21:30.341665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.345353Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.345353Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:253ec3707339dc1f2dc701933904f9d46057ef390502fdfe05839989e4b04df4","observation_id":"e74b460b-b72f-4871-8416-8e9308c7f2c5","resolution":{"observed_at":"2026-08-15T22:21:30.345353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.349198Z","title":"Multi-reward as condition for instruction- based image editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.349198Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:95b54ec8c44640d7db19624d4a5257bb692b43f3be1a7f64aec073982ef7ae3d","observation_id":"22104682-3486-4b52-be63-5681df19ef9c","resolution":{"observed_at":"2026-08-15T22:21:30.349198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T22:21:30.353022Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.353022Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:ff67c400aa9cb430a927775249a12992e40d735c2e0218a76d0cc28f940ab295","observation_id":"d0d1cd56-4605-432d-be82-cf9ccd8d4fb6","resolution":{"observed_at":"2026-08-15T22:21:30.353022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.357040Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.357040Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:d38e0bb2565d6e5796c1da034191a46d826db104736293629e28211a952c4c0c","observation_id":"c375f887-d5d7-4c3d-aec4-040d63f3450c","resolution":{"observed_at":"2026-08-15T22:21:30.357040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.360719Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.360719Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:422bcf6b5433e9dd9639b7572da87b38cce2927e3624b4162ad4f6504b9c9726","observation_id":"9008339b-3c99-4b71-b876-bd54ceb307cc","resolution":{"observed_at":"2026-08-15T22:21:30.360719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-15T22:21:30.364795Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.364795Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f028dcd57a86a789c232c4487cbe989debf56bbb4db65d575d22b3c50851aec4","observation_id":"ea04f245-2ca7-43ce-86c9-de5e3eb8ccfd","resolution":{"observed_at":"2026-08-15T22:21:30.364795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.368820Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.368820Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5618350f08d042e0997c953eab99726a5067ecc577c4eddab84affbabe1c1352","observation_id":"be4a4dcf-ca40-44ab-a1cc-4ae519122d56","resolution":{"observed_at":"2026-08-15T22:21:30.368820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.372389Z","title":"Hidream-i1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.372389Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:827907ede2b2d3ffb5a9b5ca8a7f96c3ba1db4fe15f6cb5116d09b0a4ee03ca8","observation_id":"f6dfcb11-85d6-4a44-ab43-ed323029bb19","resolution":{"observed_at":"2026-08-15T22:21:30.372389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02230","last_updated":"2018-12-05T21:21:09Z","snapshot_observed_at":"2026-08-15T03:54:20.493152Z","submitted_at":"2018-12-05T21:21:09Z","title":"Towards a Definition of Disentangled Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02230","snapshot_observed_at":"2026-08-15T22:21:30.376368Z","title":"Towards a definition of disentangled representations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.376368Z"},"links":{"cited_paper":"/paper/1812.02230","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5cde60a06d26d934b5368dfb1837aa7bf262cf06188b262fc795999de1fbb3e5","observation_id":"f0981535-08e6-4647-857a-c8cc885f2a74","resolution":{"observed_at":"2026-08-15T22:21:30.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-15T22:21:30.380408Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.380408Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:0d6414f544c09490badc2646afc8e4c5f2d94a04ab3c71a291a9288ee9f73c6a","observation_id":"75fc73ab-7688-47e6-ae52-f7588a43c1de","resolution":{"observed_at":"2026-08-15T22:21:30.380408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.384364Z","title":"Disentanglement via latent quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.384364Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:c4d335bcfd9c1fab912ca4c5abe717c84b8b4e75dc5af161d6a8d689f5ca6ddd","observation_id":"52adf81e-6273-4639-95ac-4b5d69bccd39","resolution":{"observed_at":"2026-08-15T22:21:30.384364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-15T22:21:30.388080Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.388080Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:fd2e373716721eb2bd142fe4ea1f15f1baf9ee9c55d07eb5c05efbb0c99287d7","observation_id":"d12a027a-dfe5-4133-9a00-33d89758b782","resolution":{"observed_at":"2026-08-15T22:21:30.388080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.391981Z","title":"Understanding square loss in training overparametrized neural network classifiers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.391981Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:176a162243fe14a9a3ffbc284882e3fe50e19ce026f9979057ef63096bf401dc","observation_id":"c963e1d4-ab50-4d81-9524-bb2df27de48c","resolution":{"observed_at":"2026-08-15T22:21:30.391981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.395749Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.395749Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:368f84a919a76091c809e59b1ed852bbb8d2e64620ab2486b6ce387f3d9e9fd9","observation_id":"83e7ce75-2c5e-4f4f-9023-2dc9c52a0acb","resolution":{"observed_at":"2026-08-15T22:21:30.395749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-15T22:21:30.399476Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.399476Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:798b4a58a7bc5f98a6f91ce6d30beb5347390cef14c3c9a0b9667e2b003f8cc5","observation_id":"6a26f0c4-bff6-4557-b824-6f5a2d25b334","resolution":{"observed_at":"2026-08-15T22:21:30.399476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-19T19:58:25.723399Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-15T22:21:30.403344Z","title":"Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.403344Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:d231499fd6e717618628e745e9f36e26f2072a69657923e7d31cedfc35c0525c","observation_id":"51c076d4-e036-45df-8d6e-4ffa10990a75","resolution":{"observed_at":"2026-08-15T22:21:30.403344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-15T22:21:30.407073Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.407073Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:b81b33315285abc701de7e6ba5129901e3ef31505387353ebdb84c928770a5ce","observation_id":"14de0ede-ca8c-47b0-be8d-1d1c7705329f","resolution":{"observed_at":"2026-08-15T22:21:30.407073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.410913Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.410913Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:96f0becfdcb6466a511e382be523b43c156e624430c0f8407d30b19fee485ea0","observation_id":"cc83c1e5-7927-4d0a-9849-b6b5e2cc9f5f","resolution":{"observed_at":"2026-08-15T22:21:30.410913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T22:21:30.414578Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.414578Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:c46e4f49282ae08e67750b14c9df00a45054a6c765d118bd716bc1d35f34f871","observation_id":"31569132-050a-4f63-9b7a-11fb77f66b6e","resolution":{"observed_at":"2026-08-15T22:21:30.414578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01506","last_updated":"2023-10-19T13:02:21Z","snapshot_observed_at":"2026-08-16T14:55:45.043779Z","submitted_at":"2023-10-02T18:01:55Z","title":"Direct Inversion: Boosting Diffusion-based Editing with 3 Lines of Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01506","snapshot_observed_at":"2026-08-15T22:21:30.418517Z","title":"Direct inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.418517Z"},"links":{"cited_paper":"/paper/2310.01506","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:23deb2642d8bfbaf0e40a3d2c89a756c402f00f450db6b5234468cce0a47e7d9","observation_id":"4fa7caed-f4d6-4004-b5e1-ed066c383b44","resolution":{"observed_at":"2026-08-15T22:21:30.418517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-16T02:35:29.869873Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-15T22:21:30.422247Z","title":"How far is video generation from world model: A physical law perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.422247Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:1ef6a136eee24ba0aba5d57c78307c3d97cdee53b440b094a778d43ee4b2c9c5","observation_id":"bf054325-6558-464b-bb1f-89483c73c190","resolution":{"observed_at":"2026-08-15T22:21:30.422247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.426541Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.426541Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f4aa0c7d483f76c98f644eeb0ede2765143cca0b66c7cdbe20d8e3e7cd950dae","observation_id":"ceab6c74-a369-4d70-a599-4527d22ebb47","resolution":{"observed_at":"2026-08-15T22:21:30.426541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-15T22:21:30.430410Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.430410Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:32fb7b258bc393bcc3a60f62e621c0e652e339d03210ae03704a5886a7b83918","observation_id":"4d0085df-d7ba-4c1c-8a1d-41f8b1f22403","resolution":{"observed_at":"2026-08-15T22:21:30.430410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.434319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.434319Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:bc8abc2781dcbf0b8dcd3500ef1350699f054c0c0607bae9204c0f6270eb8092","observation_id":"f702821b-c99b-41a7-b5a3-92b935fa8518","resolution":{"observed_at":"2026-08-15T22:21:30.434319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T22:21:30.437925Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.437925Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f5d7ca3f8bed14290f8d6585909926595791e2ac5f62132b795eba6d25466676","observation_id":"d8c11688-a2cf-40fa-8f0d-19d79cc1e8bc","resolution":{"observed_at":"2026-08-15T22:21:30.437925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-18T10:39:20.785091Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-15T22:21:30.442907Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.442907Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:23630baa0448ebd72df9cfed3ea8a27fb76d7d43e1fcd329bf5a332daec392fc","observation_id":"638fe5f2-d579-49c6-b51b-a6015cc8c741","resolution":{"observed_at":"2026-08-15T22:21:30.442907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-15T22:21:30.446932Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.446932Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:071799de0ad9c81921ba61bb313d4ff9e85bc0ddb3f894d9aafd81dbc91af785","observation_id":"669ea675-efc2-4d0c-a58f-774f01abd0b6","resolution":{"observed_at":"2026-08-15T22:21:30.446932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06169","last_updated":"2025-03-17T08:11:52Z","snapshot_observed_at":"2026-08-17T14:07:57.009857Z","submitted_at":"2025-03-08T11:13:05Z","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06169","snapshot_observed_at":"2026-08-15T22:21:30.451070Z","title":"Treble counterfactual vlms: A causal approach to hallucination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.451070Z"},"links":{"cited_paper":"/paper/2503.06169","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f162b113db99de2699d904fd6aa798e948245cb5a76d6e3aacdfa491917bf685","observation_id":"4ff91796-5c1c-47e5-b54a-d5910d5e363a","resolution":{"observed_at":"2026-08-15T22:21:30.451070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.455088Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.455088Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:404e6a4c94dfaca81063a0f9bf2f5175a04d044ca10e69a7365d342eeeb18a3d","observation_id":"782a4c0a-4cfa-4dc9-a351-52f26267352f","resolution":{"observed_at":"2026-08-15T22:21:30.455088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-16T13:13:16.202764Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-15T22:21:30.459345Z","title":"Imagefolder: Autoregressive image generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.459345Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5a06c649acc5c8e0fd4c8b5be8fe0a1339d96bd633601bad58447a7a7ecf4f85","observation_id":"2c8f42cf-5769-45ae-b5ad-a831411f96a8","resolution":{"observed_at":"2026-08-15T22:21:30.459345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-17T01:12:01.354637Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-15T22:21:30.463448Z","title":"Dual diffusion for unified image generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.463448Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:68287bf1028af3f841e003c17622cead5953926bab6a607946a04e9b60a6e586","observation_id":"f1d1ac06-1cbe-4fe1-b592-baa21ad21ed5","resolution":{"observed_at":"2026-08-15T22:21:30.463448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.467625Z","title":"Reasoning physical video generation with diffusion timestep tokens via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.467625Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:dd479f4c4a239f5eca7acd406e1d190758839e064b3c4a3dd68dafc573b07437","observation_id":"c3331cd3-151f-432c-8772-f813f68b1b87","resolution":{"observed_at":"2026-08-15T22:21:30.467625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.471362Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.471362Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:0dcc1ef77e97bc019ff046139fe2e852cf0f488eccd0088a8f67a4e1d3f16734","observation_id":"650a9e5d-0bb0-4bc0-91cc-02f0d8a87581","resolution":{"observed_at":"2026-08-15T22:21:30.471362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-15T22:21:30.475012Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.475012Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:9778395961c99f5ee7b232dd1748c6902a219a8b4803706eda37f605361bb556","observation_id":"38e8b85e-d58d-45d3-974e-de7f82eeba7d","resolution":{"observed_at":"2026-08-15T22:21:30.475012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.479803Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.479803Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f77c1024548e1daa19f5d452d8f7a44d757f0e61a64ef40ccac2b29c7f45eddc","observation_id":"d0a3c5b7-16bf-496b-9f39-89daf0ce0226","resolution":{"observed_at":"2026-08-15T22:21:30.479803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.483451Z","title":"Challenging common assumptions in the unsupervised learning of disentangled representations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.483451Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:304bcd57dfdf17c95479ab74a94037b04b1286f6a960bd9aafc838975c14a3f5","observation_id":"a8bb7a61-f1f1-4cb4-98b1-8dbc6d12f36e","resolution":{"observed_at":"2026-08-15T22:21:30.483451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-18T20:12:50.297525Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-15T22:21:30.486994Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.486994Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5af5070ec330d44d1bab722ad832c39d36288ba315570213d7c0862e7f57b49f","observation_id":"130c5350-07d0-4c92-861f-bccfcfe3b785","resolution":{"observed_at":"2026-08-15T22:21:30.486994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03595","last_updated":"2025-03-05T15:28:50Z","snapshot_observed_at":"2026-08-16T12:52:49.525638Z","submitted_at":"2025-03-05T15:28:50Z","title":"Towards Understanding Text Hallucination of Diffusion Models via Local Generation Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03595","snapshot_observed_at":"2026-08-15T22:21:30.491285Z","title":"Towards understanding text hallucination of diffusion models via local generation bias","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.491285Z"},"links":{"cited_paper":"/paper/2503.03595","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:b6047a0127061539264a8880f64280373b7f875f6b451f297073a3b7947045bc","observation_id":"acedce9a-1579-48bb-9fe1-06eb4d750e88","resolution":{"observed_at":"2026-08-15T22:21:30.491285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-15T22:21:30.495041Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.495041Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:dd0ddb2d040d32fded735c616e9a876d265664b531e76bfd2b9a5d9dd502ebce","observation_id":"4b433d4f-0686-4bbb-b350-b52ac039d73f","resolution":{"observed_at":"2026-08-15T22:21:30.495041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-19T14:16:58.804962Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-15T22:21:30.498950Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.498950Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:fc8d2d4efbd4d6e26398f73528002de9d779e935c234d38934780d5ecdb6c272","observation_id":"8d68e5e7-dcc4-4377-9907-c7a83d748fe4","resolution":{"observed_at":"2026-08-15T22:21:30.498950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.502722Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.502722Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:ef9ff33b7b191e470cd74d635be4c3a7b34c73bda5c4b066f8141995b6afecd6","observation_id":"3c96c7b6-7fbe-49f9-b0dd-369b6adf1f90","resolution":{"observed_at":"2026-08-15T22:21:30.502722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01203","last_updated":"2024-07-13T06:47:10Z","snapshot_observed_at":"2026-08-16T14:38:12.284636Z","submitted_at":"2023-12-02T18:55:26Z","title":"Harnessing Discrete Representations For Continual Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01203","snapshot_observed_at":"2026-08-15T22:21:30.505976Z","title":"Harnessing discrete representations for continual reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.505976Z"},"links":{"cited_paper":"/paper/2312.01203","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:2a45b0d7c4180e9bcc6252e12f0079ff22bb2b74fadaa35a1e8d2fe23eb55b0d","observation_id":"a91bb8fd-1208-4e09-bbe6-003023b3a0f2","resolution":{"observed_at":"2026-08-15T22:21:30.505976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.509513Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.509513Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:0095ab0f2db2c4a36cbee698abf58f5f499dfeb3bae6e79dfd5acf1a959ea5bf","observation_id":"295121ef-bf11-45ed-baad-4c4c7b2cd27b","resolution":{"observed_at":"2026-08-15T22:21:30.509513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10064","last_updated":"2025-01-17T09:29:33Z","snapshot_observed_at":"2026-08-13T17:02:34.924212Z","submitted_at":"2025-01-17T09:29:33Z","title":"One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10064","snapshot_observed_at":"2026-08-15T22:21:30.513108Z","title":"One-d-piece: Image tokenizer meets quality-controllable compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.513108Z"},"links":{"cited_paper":"/paper/2501.10064","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:7802d3e4ea30792ed4a1d33e969dd51200261447b6b83651b541f15ebcb02ef3","observation_id":"73b3651f-b484-44e8-95f0-3b96b46efae4","resolution":{"observed_at":"2026-08-15T22:21:30.513108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.517221Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.517221Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:b126e282b881a1b955faaf1f053be8fe16fe8e77fab04aee08b6eb416acb0eea","observation_id":"e4a2fde6-0611-4cbf-840f-c6c847e03f39","resolution":{"observed_at":"2026-08-15T22:21:30.517221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04699","last_updated":"2025-01-08T18:59:35Z","snapshot_observed_at":"2026-08-15T21:39:35.554722Z","submitted_at":"2025-01-08T18:59:35Z","title":"EditAR: Unified Conditional Generation with Autoregressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04699","snapshot_observed_at":"2026-08-15T22:21:30.520930Z","title":"Editar: Unified conditional generation with autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.520930Z"},"links":{"cited_paper":"/paper/2501.04699","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:8fadfc923b41ad8dfbce0b8695326a4e487f32a5bc13fadf371c5ec8d7900217","observation_id":"14eed918-d081-43cb-9f97-983475a75d0f","resolution":{"observed_at":"2026-08-15T22:21:30.520930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.524812Z","title":"Introspective distillation for robust question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.524812Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:24e6179b96b6bbd5af4d35feb4cd2b2f12ddff770f74d165157374e7dd3660de","observation_id":"b9802df9-2822-45ff-bc41-d9f2cc0bf94d","resolution":{"observed_at":"2026-08-15T22:21:30.524812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.528336Z","title":"Introducing 4o image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.528336Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:c5183b5357146ce51e4712879427dec2075b2b5bcfb812d5af063b1b6c15ce62","observation_id":"78feb04b-55de-456d-84a0-974af26d6921","resolution":{"observed_at":"2026-08-15T22:21:30.528336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.535548Z","title":"Vr-sampling: Accelerating flow generative model training with variance reduction sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.535548Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:f1096cc7e8be5151034ff7e13e07b555d82059d0eb1f27428e56195c2c63a3e3","observation_id":"38130b36-fe3e-456e-af8f-8028d8c4f217","resolution":{"observed_at":"2026-08-15T22:21:30.535548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.539119Z","title":"Generative mutimodal pretraining with discrete diffusion timestep tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.539119Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:32e1bb01d42942457cef3d68af9c609a3e9002ddb1576d8afddd1f01ad5ef1ea","observation_id":"187a22fe-1b94-4757-8902-7af3cbf38d28","resolution":{"observed_at":"2026-08-15T22:21:30.539119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.542780Z","title":"Auto-encoding morph-tokens for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.542780Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:689c8afaa9ae3e22cefea053b73beebbdcafa565521165cec591e9970dccd7e9","observation_id":"89ae4d76-8d74-4db0-9dfb-083496ba9fc5","resolution":{"observed_at":"2026-08-15T22:21:30.542780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.546159Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.546159Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:648b110d2f2eb10bad4712ac1a2b6bee6ab8134b93c22a168d1d3646f7158766","observation_id":"4e8b4275-9989-4de7-9c77-75cbc84b8e59","resolution":{"observed_at":"2026-08-15T22:21:30.546159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.549753Z","title":"Causality: Models, Reasoning, and Inference","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.549753Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:e5cc8af70ddc98a64cca1bb5e504cedee4e85c5362405707249f750484f7ffa7","observation_id":"77b23f67-bd63-4b4d-a0ee-b9dcbd2e5b57","resolution":{"observed_at":"2026-08-15T22:21:30.549753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-16T12:43:10.838199Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-15T22:21:30.553319Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.553319Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:7cefc890902ac7eea034cc91cb9035a4e4a23fc55b000309a2068d408b042580","observation_id":"bb65c5c8-00e3-4078-a0d2-df32dae0e28e","resolution":{"observed_at":"2026-08-15T22:21:30.553319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T22:21:30.557129Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.557129Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:e2583fa3908175a52f25b21c0f8199a18a0a2fd289d9dd7385711e87e7b860d9","observation_id":"02149c5b-f559-4752-ac53-ef88093378a9","resolution":{"observed_at":"2026-08-15T22:21:30.557129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-15T18:07:41.591747Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-08-15T22:21:30.561032Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.561032Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:5e0783b7052b8910ec8f5a33a6ab969c7f7f27710bdd8265151ddb37e85402e1","observation_id":"2356c3ea-3ece-449c-b702-cc2e7d541be6","resolution":{"observed_at":"2026-08-15T22:21:30.561032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.564777Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.564777Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:659ae02fd0a50e82d36fffa46d175e52d71dae8b08842cbe5b5e533f5cb97bfc","observation_id":"802ec8bc-4b74-460d-ae0c-f15b9c2b12b9","resolution":{"observed_at":"2026-08-15T22:21:30.564777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.568462Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.568462Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:d6614598e7357e8a922670fa05427e1bbd986d6dba91a9ef366ca4202aac177c","observation_id":"75424c96-1a2c-4633-8e32-dafe9d1d6321","resolution":{"observed_at":"2026-08-15T22:21:30.568462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.572003Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.572003Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:075276a07907392ff49cbbeb034232b3e1e0e6ec251503dff1ef3bc65a20ed33","observation_id":"f2497048-f8a6-4268-89ee-4bcd31d7fed8","resolution":{"observed_at":"2026-08-15T22:21:30.572003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.575674Z","title":"Flow to the mode: Mode-seeking diffusion autoencoders for state-of-the-art image tokenization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.575674Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:d339ba59e8ee45070114078904f669a9e1f9dee5d8028540356ba44db5cd58fd","observation_id":"83a59e16-9733-4722-905a-dd575b9d595b","resolution":{"observed_at":"2026-08-15T22:21:30.575674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.579716Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.579716Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:05dc5da770a30c8c3fb2f1f297f47bcb53aefa71eb639b6913507198d7d416b5","observation_id":"cb2ef13d-a3dd-4eca-83a2-c05ece23b561","resolution":{"observed_at":"2026-08-15T22:21:30.579716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.583257Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.583257Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:b9bd6c842f81085ec6710a03858d95cd8bed6e22c30a8f5910132613fda6efa4","observation_id":"e6e89895-4e7d-4fca-baac-551e9fb179e6","resolution":{"observed_at":"2026-08-15T22:21:30.583257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:21:30.586551Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.586551Z"},"links":{"citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:aa4ce2669b8e8d50a35b0a05f75d1f1212abae19128bb28557f975c97432a77f","observation_id":"e41c0708-7ad9-43ed-ba2d-1d4e640e7c82","resolution":{"observed_at":"2026-08-15T22:21:30.586551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T22:21:30.590027Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.590027Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:1ea88cd463e692f144329f361f8f45bc0d68943c773cc80922c6d409c514b364","observation_id":"0cbe20a1-c749-408a-b1f0-27a512be7887","resolution":{"observed_at":"2026-08-15T22:21:30.590027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-15T22:21:30.593828Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.593828Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:3d5cfae78e85d578b98b694398776e339e9b2d71dd94304d2bbceed7822eb497","observation_id":"2955a866-7621-422d-b9f1-339861e7bc32","resolution":{"observed_at":"2026-08-15T22:21:30.593828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06686","last_updated":"2024-11-11T03:06:26Z","snapshot_observed_at":"2026-08-16T13:01:19.263484Z","submitted_at":"2024-11-11T03:06:26Z","title":"SeedEdit: Align Image Re-Generation to Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06686","snapshot_observed_at":"2026-08-15T22:21:30.597877Z","title":"Seededit: Align image re-generation to image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.597877Z"},"links":{"cited_paper":"/paper/2411.06686","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:03dcacddb247bf40775d183a26dcb60532c6bc2880cce0397ca2b90e58279248","observation_id":"907a28fd-2965-4100-888f-d76998e92674","resolution":{"observed_at":"2026-08-15T22:21:30.597877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11807","last_updated":"2020-06-21T14:10:47Z","snapshot_observed_at":"2026-08-15T03:47:44.912407Z","submitted_at":"2020-06-21T14:10:47Z","title":"Improving Image Captioning with Better Use of Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11807","snapshot_observed_at":"2026-08-15T22:21:30.601457Z","title":"Improving image captioning with better use of captions","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T22:21:30.601457Z"},"links":{"cited_paper":"/paper/2006.11807","citing_paper":"/paper/2505.07538"},"observation_digest":"sha256:23d2809e91020e5dc6066f8a2ac4a2951e6950d05307a709e36b644ee9e54634","observation_id":"547786c1-c51d-4328-a325-36cbdf87e25f","resolution":{"observed_at":"2026-08-15T22:21:30.601457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07538","last_updated":"2025-05-27T11:07:09Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:52:19.014030Z","submitted_at":"2025-05-12T13:19:08Z","title":"Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":136},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 136 outbound references and 10 inbound Pith citation observations for arXiv:2505.07538."}