{"as_of":"2026-08-06T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b64a1d66ba0d167ad6e63e6a09d21eca423d26f252b239dc94c1ddbbcb66e417","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:10:14.308216Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.11096/citation-record","integrity":"/paper/2606.11096/integrity","json":"/paper/2606.11096/citation-record.json","paper":"/paper/2606.11096"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:eda28e0ef020f244d22af5f3fa81202f555aa2c2451e1608775ddcc30c334607","observation_id":"1ab62cca-5d5f-41ad-b3fa-81091aad638d","resolution":{"observed_at":"2026-07-03T05:27:40.595343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Perception encoder: The best visual embeddings are not at the output of the network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:079896f365741422ef3e12959cfcf399e512976688b8b8b9c1408e176e828c46","observation_id":"07ad680f-c33f-452d-b693-145cfcb517bc","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Perception encoder: The best visual embeddings are not at the output of the network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:503977e193196ba85bd04af0b1d7d0359a17a0c1d605b47e7149fbbf8ecfc712","observation_id":"5749fc2b-6f54-41a4-8636-6289b596f651","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:48a821733bad140b241b76465b533bcc16816b7b0365144f8a863a47ba4cd020","observation_id":"454d1247-f1ab-4ff3-94dd-f056b3f411d1","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:29fed41aabfa058f0bbe0c5b612268468f447d35b629e3f3e167f153ec2e88b2","observation_id":"8beec1cc-4d1c-4b4c-aee1-66d02d65ec5b","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18931","last_updated":"2026-07-20T15:46:10Z","snapshot_observed_at":"2026-08-05T05:47:38.618391Z","submitted_at":"2025-03-24T17:52:47Z","title":"Enhancing Vision Foundation Models via Multimodal Continual Pre-Training","version":3},"cited_work":{"arxiv_id":"2503.18931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18931","snapshot_observed_at":"2026-07-21T02:21:17.004501Z","title":"arXiv:2503.18931 [cs.CV] https://arxiv.org/abs/2503.18931","venue":null,"work_id":"2f29c7d0-fdbd-4dcf-9560-f60e21d8d309","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2503.18931","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:fb8d3306f4178aed13340c04cf77ba26d2efee8f6c114c585e70516868b0acf9","observation_id":"4d778a25-db20-48c7-afae-87c9e024a33f","resolution":{"observed_at":"2026-07-21T02:21:17.004501Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:190104c2282424b0b9bc306f7745456fea6a67256dfb83fbaa4148d5e3bfc739","observation_id":"22f0a495-3c75-4f05-baaf-050fe6b32d74","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2009.520684","doi":"10.1109/cvpr.2009.5206848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Dong, W","venue":"2009 IEEE Conference on Computer Vision and Pattern Recognition","work_id":"effdb28b-742e-4840-b3ca-d89502a6cd4d","year":2009},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:355acc0bed8bed17401b2b583157dc582010d2279712cc1a11e276d53353da8e","observation_id":"b015d138-e0cc-42db-9987-83281921b62b","resolution":{"observed_at":"2026-06-27T13:10:55.714993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.271549Z","title":"arXiv preprint arXiv:2511.23386 (2025) 4, 7, 9","venue":null,"work_id":"39f6030c-4966-4a81-911d-fbd41f4329fa","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:890f714d7133bc9fee71b621dd005b0220a89b3caa36040c3e4a09adab4c302e","observation_id":"23545e46-2959-463f-8052-510b0feae8c6","resolution":{"observed_at":"2026-07-03T05:37:40.273079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b3adbe77722e5aee8d80d4b3312c95eddeac547a160bb73150e2eadab8738288","observation_id":"705bcac2-f4b6-4c43-8c5e-81cbf877b30d","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:fcda9192c9a7b804bc086dd0645cec31ab168c6aae164524fb21b7c6e32125f5","observation_id":"96559e00-7569-4b47-a837-4d40fda3ee64","resolution":{"observed_at":"2026-07-03T05:37:40.215118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:53.790634Z","title":"One layer is enough: Adapting pretrained visual encoders for image generation","venue":null,"work_id":"c17af60a-6f9a-46c8-8b21-915407f8d12b","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b5055e8a542c1e2d2335b56868592e43c658fa5860050fbceb39f7e5d40a823a","observation_id":"2720aa33-4bf1-4df2-9ede-0fe84d596420","resolution":{"observed_at":"2026-07-03T05:37:40.222807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03638","last_updated":"2022-09-24T20:49:24Z","snapshot_observed_at":"2026-07-06T12:57:58.716731Z","submitted_at":"2022-04-07T17:59:02Z","title":"Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive Transformer","version":4},"cited_work":{"arxiv_id":"2204.03638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.03638","snapshot_observed_at":"2026-07-03T05:27:40.599122Z","title":"2022 , journal =","venue":null,"work_id":"83e7f977-dcd8-45f3-9605-f4fd41758d04","year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2204.03638","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:d9d5374968cc20645f3d195e05dd8ae3bb8aafbb06e20b762407d1ecf127ac74","observation_id":"f0612a31-cdc8-4585-8221-891bffb55bc5","resolution":{"observed_at":"2026-07-03T05:27:40.600866Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:bec9277cdfc413805a983e16376fbec8d44ae4e7220487906efeeaa3e02ec7c7","observation_id":"e38956fe-f930-4997-938f-1ba8d2f9deaf","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:51078fd3aabd3522dc82a6776615704aa6a62fb1b480e751c0d0e483d3d5b15d","observation_id":"f0b29bcb-567e-4895-8630-319c76e13cbb","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":"1902.09506","doi":"10.48550/arxiv.1902.09506","metadata_source":"pith","pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","venue":"cs.CL","work_id":"2812ce3d-dce9-486d-b3c5-6261a28e786c","year":2019},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:1c8086becab8be3a13ecd3ecb0120e0a1b15a9a7c3e8575acb7b8c08f4585e95","observation_id":"e56af5a1-2663-49f7-bc14-9c012f43a31f","resolution":{"observed_at":"2026-07-03T05:27:40.598033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:46.821192+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:46.821192+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Image-to-imagetranslationwithconditionaladversarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:df9c73398c4ed82f71dabcb5835f4998a0b846fdad226a00735bc4d4a919a0bc","observation_id":"c6ba7bee-4500-4af8-926c-d3803b477c5e","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.281987Z","title":"Dino-tok: Adapting dino for visual tokenizers","venue":null,"work_id":"df421354-5f27-4b43-8a66-101b1229c47b","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:5c9738d5c671bf6d5320daafc369fd7adab850d3d55ec5f9c955c550ad292748","observation_id":"ffcb0b9a-e1d7-4277-bca8-0e8a45bf70f2","resolution":{"observed_at":"2026-07-03T05:37:40.283600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpami.2010.57","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Trans","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"97378a9d-7daa-4077-9fe3-b9f143593221","year":2011},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:8a5286936e7389f185309f7530e991d6f857aa65879d6abdb7c0550150c7e73a","observation_id":"15cac6ff-370f-4925-956d-f63befdbadc3","resolution":{"observed_at":"2026-06-27T13:10:55.711184Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T04:50:25.84674+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T04:50:25.84674+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:a3260f537403f9f911186ed0211ee19674688945bd79297ef7dab8d8a41e23dd","observation_id":"6c2d7fc6-2cd3-4557-9d91-6999b73609ac","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-020-01316-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"International Journal of Computer Vision 128(7), 1956–1981 (Mar 2020)","venue":"International Journal of Computer Vision","work_id":"62ef6473-874f-4e95-8846-5210fe18eeab","year":1956},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:6a308fa024f2209d6d9f147c05d2166ee1c96b13ce6e34b9c7016683d871e1d9","observation_id":"61f31447-932c-481b-ab85-22acfc9a264f","resolution":{"observed_at":"2026-06-27T13:10:55.722165Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:19:54.150959+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:19:54.150959+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06991","last_updated":"2019-10-30T12:33:29Z","snapshot_observed_at":"2026-07-06T07:46:06.039145Z","submitted_at":"2019-04-15T12:20:32Z","title":"Improved Precision and Recall Metric for Assessing Generative Models","version":3},"cited_work":{"arxiv_id":"1904.06991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.06991","snapshot_observed_at":"2026-07-03T14:08:22.365373Z","title":"Improved precision and recall met- ric for assessing generative models.CoRR, abs/1904.06991","venue":null,"work_id":"cee1b7eb-f61f-4bb1-ab36-d9dcf837317a","year":1904},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1904.06991","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:cf6f2fc1689cc608feee46d10da163389892a27e1207bc8e81c81e15016d38ba","observation_id":"1eab0458-211a-4198-96b4-33a72c865654","resolution":{"observed_at":"2026-07-03T05:37:40.270431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01941","last_updated":"2022-03-09T09:11:16Z","snapshot_observed_at":"2026-08-06T03:47:01.974156Z","submitted_at":"2022-03-03T11:44:46Z","title":"Autoregressive Image Generation using Residual Quantization","version":2},"cited_work":{"arxiv_id":"2203.01941","doi":"10.48550/arxiv.2203.01941","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.01941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Autoregressive Image Generation using Residual Quantization , journal =","venue":"arXiv (Cornell University)","work_id":"b6f831bb-bfd8-4bf2-8fc6-2f3a9e99e919","year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2203.01941","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:1b4e820717df4d2d500aadad7aa5eff74b539a0b9c663818a4494aefdaac8248","observation_id":"5427997b-3428-4439-85d4-924984e7d9bc","resolution":{"observed_at":"2026-07-03T05:37:40.275626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:3fecc3306e299ad51d0d8463fdd22c05dfd5b445fee147a5e6f9d19277f9979d","observation_id":"35d9ed1b-5a95-462a-9335-da525c8cd3a8","resolution":{"observed_at":"2026-07-03T05:37:40.278177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":"2410.01756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-07-03T14:38:28.817961Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":"31c3d642-f3a7-4326-8674-523c08c24d7c","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:6dd13b9e6548926c01ebf83761c679e2f89a4669e4e7fda71ccd35ead98edb0d","observation_id":"280769d0-f1ae-473a-925a-d3bc569611a0","resolution":{"observed_at":"2026-07-03T05:37:40.280769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:ff60f612933caea7f0157787dddccbcb1a38248910096c5846a0eb9cf6fbdf36","observation_id":"0770a158-b49d-4e95-b517-b1abafc45488","resolution":{"observed_at":"2026-07-03T05:37:40.267740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:bc5b8ac00d68f51dfbd48bc3375f11388222ce5a75d873699637270ba58588bf","observation_id":"06c401a8-aacf-4f6c-8e64-a06402f842f2","resolution":{"observed_at":"2026-07-03T05:37:40.238479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:d2543de265e34c6cce6e5f2d6bda064cfc617cd6d82056cf9b66c728d3d75b15","observation_id":"91a599a7-5ba8-4feb-a32c-3c19314911bd","resolution":{"observed_at":"2026-07-03T05:37:40.217854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:83b585646ac08e38386525e02f37b6c996e2fae9f157166279f44fb81cf3f085","observation_id":"bf7e34d4-748f-450b-bd7f-e26c7d52d446","resolution":{"observed_at":"2026-07-03T05:37:40.204519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":"2401.08740","doi":"10.48550/arxiv.2401.08740","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers","venue":"arXiv (Cornell University)","work_id":"efcaad69-2861-4567-816a-32bc85edb681","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:36e9bd5b029185dcc9f142d889c56471fadc326922c04806e99cee5b73d9858e","observation_id":"80798ca6-a46a-486a-895f-f7cd2c7c48be","resolution":{"observed_at":"2026-07-03T05:37:40.229595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:afd8085b9b7295e3a2793463c92d0e85835fd4a2999b2bf7c80357c9cf4cc7aa","observation_id":"68859522-0407-4f53-af23-8ed249757b50","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Docvqa: Adatasetforvqaondocumentimages","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b9de11e49423b2acfc466b0ddd8dada1b322b5fb58baae47ecd1febe20794f4e","observation_id":"1b5aea5d-75da-4423-9297-ff48dbb72219","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:f83e9c30e1805fa5df85b85cfe1f803a2775776d375a6c90bb00154fd38095be","observation_id":"1d135103-6b18-490a-b525-88df7750b719","resolution":{"observed_at":"2026-07-03T05:37:40.254393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:689c07544f53711427f0ac7b75334e1db73313465e782ca166bd38ef035a641d","observation_id":"c9a3ae1c-d32b-4e07-883c-3941afa5c276","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:f5a30ecb689194f9e2a9b58ea3dbaeb77f732e516ded76dfe662da22e24ff02c","observation_id":"2ef515e8-27f2-414e-a768-5e56e8441a70","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:aa371bcf17784eda00694332c33e99ec1bf42cf09fceb9529a3f5d5dac56265e","observation_id":"645d9226-af78-4eab-8101-401f697c3ac0","resolution":{"observed_at":"2026-07-03T05:37:40.201979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Generating diverse high-fidelity images with vq-vae-2, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:1c0b366428aa18424377ca16972d14fb81fda9ac2b3913926b7676c5b0d8184a","observation_id":"85ae22e2-031f-448e-ac44-1642b3a56903","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20388","last_updated":"2025-03-20T18:15:30Z","snapshot_observed_at":"2026-08-01T17:30:39.078379Z","submitted_at":"2025-02-27T18:59:08Z","title":"Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation","version":2},"cited_work":{"arxiv_id":"2502.20388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20388","snapshot_observed_at":"2026-07-04T20:50:11.364862Z","title":"Beyond next-token: Next-x prediction for autoregressive visual generation","venue":null,"work_id":"0e9ba908-c13e-44d1-993a-2ce2994b1cc9","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2502.20388","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:9f88afc2153d27cb5a9b222d70fc96d8552d44d39790c760b1c6ae48f0179257","observation_id":"27012b5f-b880-4d38-acb4-d2ab42fb7377","resolution":{"observed_at":"2026-07-03T05:37:40.221265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b1c995a34c95df41e15b2a05cd7ea992b7c2494a0408b7f23a2020947b0e67e0","observation_id":"04d5aa3a-92b2-4fb7-ba7a-5d72ac9ca1e0","resolution":{"observed_at":"2026-07-03T05:37:40.243542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:0f6661a0c721244e1818de9d805c1cb85e8206524e1c1074eaf1c95615c92c67","observation_id":"f574d2f9-70b3-400d-924f-340fea066395","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b6445c7ebe5b25bc51c542a63658be9aea2a8aa9165795c51b9902d00724e70d","observation_id":"4d2b0276-6fbd-476a-b91f-72f1a8142944","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Latent diffusion model without variational autoencoder","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:ce88471490be71e330f73f18e964bdf63c7353c180d7bced7c33abb8aceee507","observation_id":"0f377163-2b12-469a-aab1-b8df0b0e9e2d","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:ec01e1e8908c6efe3d3756bdc3fa5ac1bd1509b3bba0ec77d39ec2405dd34cb8","observation_id":"c34d26b8-8024-4de0-92a9-4a6ca2db5991","resolution":{"observed_at":"2026-07-03T05:37:40.225112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":"1904.08920","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-07-04T12:59:52.380964Z","title":"Towards VQA Models That Can Read","venue":"cs.CL","work_id":"ac628bbb-7f2b-443d-9277-6ecbad9e026d","year":2019},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:be01c400185d9faecabc52e17a19af625ac32b114006d4df524e9c331acbb89f","observation_id":"dc92ee85-2095-4ae6-957a-2a24db50dc8b","resolution":{"observed_at":"2026-07-03T05:37:40.212732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Dualtoken: Towards unifying visual understanding and generation with dual visual vocabularies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:5f074f18b558fae6c364a90c86c8b20aa6dbf7de443a5324cf96f9b03fd6898e","observation_id":"710f038f-f07f-482a-9292-0d1a144b9ba3","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:6115ab2025fa151489b04faa3857fd331d613ab2ca203d6e643434d746679520","observation_id":"2057130f-78dd-48f7-9fb8-d10e9f279a6c","resolution":{"observed_at":"2026-07-03T05:37:40.220334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:de16ca74854ecaad60d6233ddd831aa5421f9f1ff21075e3babd478beace286e","observation_id":"16b262ae-4a66-49ad-961a-7f3be5a36dd0","resolution":{"observed_at":"2026-07-03T05:37:40.259673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:e0aa1cc22413bf4febfb338eb31b2a63dd2f3671fc0814bf9bda79204914b219","observation_id":"c9faba58-3a7f-4f41-bc13-2a93e00bb89d","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:ffdaeaf48e0aebf40b0ec9c2339ba607f7c7d24901228b7cf4950379be5dfe71","observation_id":"933766f4-ca43-44d4-bb30-019b59d10094","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:2dc502bc293c2346f809f247a998e4856b10dd501d61f4f95b94873f49143ab9","observation_id":"9479af7c-bb79-4a33-b089-80f4764bba12","resolution":{"observed_at":"2026-07-03T05:37:40.251926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:59b1ff37aeeccbab2cee06407979050b14348febfb2dbecbce5fdba5cdfaf68b","observation_id":"206f7527-d29f-4e23-9b64-878c060dcb67","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-01T14:58:21.912263Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":"1711.00937","doi":"10.48550/arxiv.1711.00937","metadata_source":"pith","pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Discrete Representation Learning","venue":"cs.LG","work_id":"0148b1f3-8d2b-42bf-a801-174dc56f7597","year":2017},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:7cc527325691496ccfe59ac6ad5e1cac1706fde7d0662f92acf772887ecfdacc","observation_id":"ef620b3b-092e-4edb-b4a7-b18f0869d23e","resolution":{"observed_at":"2026-07-03T05:37:40.249509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:6ceb24dd426c563a98b29e190d6ee96d6c8a0842b870df2fc0451a04bae08a3b","observation_id":"983ba479-7068-436a-8a45-247638c713ed","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-07-06T21:09:55.394184Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":"2504.11455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-07-05T11:41:02.764172Z","title":"Simplear: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl","venue":"cs.CV","work_id":"facbbd34-503d-4c9a-b758-a9b88c18d9c6","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:e3d1a0c09beff216ad6815a72a858d000aa9d9b9ba248a4a4c35a323ad94b3ce","observation_id":"e2b1eae2-d31c-4c63-8d71-7af4e4f2e51f","resolution":{"observed_at":"2026-07-03T05:37:40.254498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Omnigen-ar: Autoregressive any-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:4a2a4871cc3bee46fda210caa731597b641c4bd82854053e92aafc020575aaf8","observation_id":"3a590ae4-e225-4455-94a5-95dc1de28959","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.01467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.533300Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think","venue":null,"work_id":"407ce442-cf54-4e53-89b5-f140df8d27eb","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:53e3fc295569682ea73b58d431c95aca5939edf918dc380f2a4d6057c9600dfd","observation_id":"5fae378a-170a-40fc-a943-38bf7090da2e","resolution":{"observed_at":"2026-07-03T05:37:40.257308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:bb2cef9a49ff0f68b29c6a5f5349defe6b64c5dee73417a8dd34b8623a9ab1cf","observation_id":"0ff29571-d063-4e14-9be4-5b8da79761cb","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Vision transformer with deformable attention,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:3789abff68893a43c1fc9bd42b643e466fb891ef446a384c6829f798d6b21ef9","observation_id":"f37b1219-676d-41bf-930f-686a8fbc47ef","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00520","last_updated":"2022-05-24T12:52:37Z","snapshot_observed_at":"2026-07-06T12:24:14.545713Z","submitted_at":"2022-01-03T08:29:01Z","title":"Vision Transformer with Deformable Attention","version":3},"cited_work":{"arxiv_id":"2201.00520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.00520","snapshot_observed_at":"2026-07-03T05:37:40.261135Z","title":"https: //arxiv.org/abs/2201.00520","venue":null,"work_id":"3bb6aee4-171d-4a8a-be0a-17fdafc44b5a","year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2201.00520","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:1638233d881479620b9436ca9704f269e3b5684e304b788bda340067f0e77bac","observation_id":"2b4e737f-8506-4735-a904-a7407279b68c","resolution":{"observed_at":"2026-07-03T05:37:40.262470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Videogpt: Video generation using vq-vae and transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:461f8dd7c1c4bbf9118b60d5f8bcb4d31903f18505beefd0229b42912df612cc","observation_id":"f893c78b-399f-4961-91cf-efbd2244dc8c","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10356","last_updated":"2024-10-31T12:49:09Z","snapshot_observed_at":"2026-08-05T14:19:16.047359Z","submitted_at":"2024-10-14T10:17:24Z","title":"FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification","version":2},"cited_work":{"arxiv_id":"2410.10356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10356","snapshot_observed_at":"2026-07-04T16:59:57.967386Z","title":"Fasterdit: Towards faster diffusion transformers training without architecture modification","venue":null,"work_id":"073ce999-fc96-44f1-9ec7-2e3e7517d328","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2410.10356","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:ba6d309d2e42776b9e8a4ac2734015d7ea43ea7e3e6bab9c66a4f0bd64e4416e","observation_id":"71145cbf-138e-4362-bb5f-bd5b55f768a1","resolution":{"observed_at":"2026-07-03T05:37:40.238986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Reconstruction vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:fb833173b84466ac7e62ad481b79945c333972f98e8a0e0ce121b9d224e49131","observation_id":"93018c37-be11-4763-8fa7-f072f62d6b3b","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:a1a24481090b1f679779354b5d244ee635e17ebb34beedabfe40e1bfa4935109","observation_id":"01cc8e07-66e7-4cf2-bfab-aba86488ab76","resolution":{"observed_at":"2026-07-03T05:37:40.241892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:07687883b285d781aff3530f143714dd2179380100a4b79a358cc98408adfa28","observation_id":"5a89d216-e243-4d74-a8de-d66eca737997","resolution":{"observed_at":"2026-07-03T05:37:40.244433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:bbad24afa025329268d26bd392f9ee8a0029a8fdb872f169093069d20049dd58","observation_id":"7aeacc02-a825-47a9-a700-c0469cee457a","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:3648630cf628670683fc5100b7151f35c0ead745c8436bff349f83a6e977eb64","observation_id":"7dc2bc2f-ae86-47ed-a132-8bdeb4826b94","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:45139cd5d05a4a182e2ff52190adc43d403313745e4e6b27969db3402d8526dd","observation_id":"f3b63dc6-6667-448c-85d4-d60709bea98e","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:d18d371864a86359b128dac631dd078c57c1e0a0f692e526d7c9010400880493","observation_id":"559fc6a7-bbc5-414e-82a8-f9eaf0a68718","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:10:14.308216Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:dfc75c1b1224b5eb720b00fd320de588dc26f1c0a7329ce8d525bfcac4141cfb","observation_id":"5e869353-1d06-49d3-88e4-c37ff811eea3","resolution":{"observed_at":"2026-06-27T13:10:14.308216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:37:40.226413Z","title":"Spherical leech quantization for visual tokenization and generation, 2025","venue":null,"work_id":"3aa94096-0a72-4256-a9e3-3d274490fac0","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:b468b776277dd6343bebbc42f029a9065fd193d8f47010a872a1a5d82f8943e4","observation_id":"5c4e9324-6488-4379-adaf-e8e7fc994412","resolution":{"observed_at":"2026-07-03T05:37:40.227816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.08441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.915950Z","title":"arXiv preprint arXiv:2507.08441 , year=","venue":null,"work_id":"f438612e-bb10-45c3-8662-4cbe16b00f44","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:c7c463bf8761f66a7824be291d9b11991b1838d21ba0079a1e4e8089e7123883","observation_id":"8e48652e-9415-4f0e-ac53-12c6a299112f","resolution":{"observed_at":"2026-07-03T05:37:40.246115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:0d51aeb7e0ae192cb1909c917a8c799c6970e8329ec4be93e8462b72e5772bfd","observation_id":"da2f3a28-03e6-4da7-963d-580fe207e836","resolution":{"observed_at":"2026-07-03T05:37:40.233253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09305","last_updated":"2024-03-05T01:10:18Z","snapshot_observed_at":"2026-08-03T18:21:25.175322Z","submitted_at":"2023-06-15T17:38:48Z","title":"Fast Training of Diffusion Models with Masked Transformers","version":2},"cited_work":{"arxiv_id":"2306.09305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09305","snapshot_observed_at":"2026-07-04T16:59:57.977754Z","title":"Zheng, W","venue":null,"work_id":"a43c3057-0634-4c2b-b3dc-78d15ca3029d","year":2023},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2306.09305","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:a427e3b6627cb2fbd39f1d23cb8541deef31dc576fe9d50ae7d63c3542bab50c","observation_id":"69277d24-07ac-4c3c-a60c-59bdb0c99a53","resolution":{"observed_at":"2026-07-03T05:37:40.236125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":"2406.11837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-07-03T16:08:37.450322Z","title":"arXiv preprint arXiv:2406.11837 , year=","venue":null,"work_id":"fc0c6688-97b8-4b86-afe4-6aa5c7f9a970","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:7cd6d1413e024511d64dd074361123a9fa32b33f18acc8e9027061b93b114389","observation_id":"80afaa1a-edb8-48a5-bfd4-a95221c22ac1","resolution":{"observed_at":"2026-07-03T05:37:40.265134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.02038","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:08:37.432195Z","title":"A Proofs for Section 3 A.1 Dense RD-AE flow We derive (6)–(7) using the notation of Section 3.1","venue":null,"work_id":"7f828fcd-5436-434e-af9d-4d9fb4c86cdc","year":2024},"citing_paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T13:10:14.308216Z"},"links":{"citing_paper":"/paper/2606.11096"},"observation_digest":"sha256:d1bdb562f0e32e55acf9ad6c7d190db3942c3b46d81ad6d6aa3aae71270eebc2","observation_id":"9325f93c-ee1f-4110-b324-ed3a0dd9fb6a","resolution":{"observed_at":"2026-07-03T05:37:40.247132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.11096","last_updated":"2026-06-09T16:53:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T16:53:30Z","title":"IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":33,"verified_exact":32,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2606.11096."}