{"as_of":"2026-08-07T21:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c15561f1ce01943fa166aeb12b158c390581527901cf36c43a7cb905b872f8ed","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:59.016813Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:28.222142Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:15:46.141356Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2601.01593","last_updated":"2026-05-18T03:12:58Z","snapshot_observed_at":"2026-07-06T22:40:41.626783Z","submitted_at":"2026-01-04T16:46:13Z","title":"Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:09.843691Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2601.01593"},"observation_digest":"sha256:e741856e81e3481f0430a32805b551589962edaec69eb80013e9387efaccb3f0","observation_id":"bb3e2471-db05-46b2-8b51-ec49be88e55f","resolution":{"observed_at":"2026-05-21T17:00:24.115442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T13:52:42.834440Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:724aca479dfbe1b391b7f23b58e45841af9758f83280dae9a8a14a02a1a5607a","observation_id":"905ba60f-6e16-45a7-972a-3ec9d6c518a9","resolution":{"observed_at":"2026-05-11T18:51:06.131823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.06137","last_updated":"2026-05-29T13:39:42Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:35:51Z","title":"Autoregressive Visual Generation Needs a Prologue","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T23:36:51.148162Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.06137"},"observation_digest":"sha256:0ca189a22259d31c60dc2d549603d749bad8e536337a275a1a8dee6bfbf78ccf","observation_id":"df5d4649-99d5-4acc-b5ba-e27dff8ba9c9","resolution":{"observed_at":"2026-07-01T13:15:46.142983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":"2507.02358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-07-01T13:15:46.141356Z","title":"Holistic tokenizer for autoregressive image generation","venue":null,"work_id":"49858cb8-ce5f-466f-8c68-68213f05656e","year":2025},"citing_paper":{"arxiv_id":"2605.16384","last_updated":"2026-05-11T10:51:02Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-11T10:51:02Z","title":"Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-20T22:41:44.510546Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2605.16384"},"observation_digest":"sha256:f8fb55d1794746157d98b5e384368f7884d0d30bd2bd4fb5c5bb9dfcd5a8a374","observation_id":"46a1e380-e7af-4fea-93f9-fef960207ce2","resolution":{"observed_at":"2026-05-20T22:43:51.011171Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02358","snapshot_observed_at":"2026-08-06T11:55:28.222142Z","title":"Hita: Holistic tokenizer for autoregressive image generation.arXiv preprint arXiv:2507.02358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-07T20:19:44.101041Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.222142Z"},"links":{"cited_paper":"/paper/2507.02358","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:9ec41bb749fdb75475279c85e4c94fea8101d929a92d73d118b2a55640ad57b6","observation_id":"ef6a5064-ee26-4008-9be6-c0ea92797d5d","resolution":{"observed_at":"2026-08-06T11:55:28.222142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02358/citation-record","integrity":"/paper/2507.02358/integrity","json":"/paper/2507.02358/citation-record.json","paper":"/paper/2507.02358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T20:38:52.370560Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.370560Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:282662157ff1f505c16f8557fd98150a73f0f5cd18fae266a74ac8e14ad79949","observation_id":"38a7daa6-d817-433f-a789-3a8c4cdfd152","resolution":{"observed_at":"2026-08-06T20:38:52.370560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T20:38:52.463671Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.463671Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:1a216a65e85ab0d18a0214435e754378d8bafd5db561d2ee474e042b5abbea27","observation_id":"26bcef4e-bfea-4b47-a269-45b8a038aeb9","resolution":{"observed_at":"2026-08-06T20:38:52.463671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T20:38:52.594227Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.594227Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:83ea575b4e08b1102ca1937022b309851d5dc8a0514d4f58d9d7b2bffbfd0219","observation_id":"f0cae618-4702-4168-9473-9b49a4c4a42a","resolution":{"observed_at":"2026-08-06T20:38:52.594227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T20:38:52.661610Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.661610Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a20d5b2749482388f7f0720eaf3ac6ef7aa4c78e1d905831bb23d21193befd55","observation_id":"6a6c0e96-5520-4e83-8984-f8992e990257","resolution":{"observed_at":"2026-08-06T20:38:52.661610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.492104Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"aeef8459-6d2d-49dc-8f6e-feb492d554c9","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.788853Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ca76c6e032dce856c70f665ccb1bddf055fd39161a042b77621b337c712c63d8","observation_id":"f2d1aca6-9934-4a6f-8e92-5c2120ce748b","resolution":{"observed_at":"2026-08-06T20:39:04.580025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.259025Z","title":"Generative pre- training from pixels","venue":null,"work_id":"75b5f1cc-f8cd-45bd-80ce-12486974bc54","year":2020},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.888937Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:4628f08cf7e63ea488a985a0a10a96388f089208332b1925d039ca26893c6085","observation_id":"78ee99b0-abfe-4513-83cc-0b384278d7df","resolution":{"observed_at":"2026-08-06T20:39:04.367468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:04.061869Z","title":"Vision transformers need registers, 2023","venue":null,"work_id":"81ba6bce-9ac1-434c-bead-085c3a68b1a1","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:52.971868Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:61b791c0e5caddd74884100db90f969734922f4921d01223c51a9eed2c677a87","observation_id":"6bf58c75-92aa-4dc5-8158-78711f2d82ad","resolution":{"observed_at":"2026-08-06T20:39:04.166656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.861942Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0f69b481-05fc-4cc8-abba-8bde372d692d","year":2009},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.061357Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:316dfc3d241fdc4d8a1f6be9475e03dd3cc66b87c768879b2bd7377d871c2c1e","observation_id":"bd26107b-5482-4545-96ec-e301477f2c7e","resolution":{"observed_at":"2026-08-06T20:39:03.961722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T20:38:53.170599Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.170599Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:05aaf38c0b3920002bed9e53c4b0f5969659a16bea46f2f20e6a74871add0c00","observation_id":"09815a26-6932-453e-8eb4-1e6aa7d6c800","resolution":{"observed_at":"2026-08-06T20:38:53.170599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.683729Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"a85f5895-7caf-4e20-9101-a85bd90b6845","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.249840Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:786e73e87cfa1b84ea02eb44af27af3209e1ed516ed79fa45f4d250d3427f8a6","observation_id":"c4afe126-cff9-4c55-823f-a13829e17d81","resolution":{"observed_at":"2026-08-06T20:39:03.752678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-06T20:38:53.354253Z","title":"Scalable pre- training of large autoregressive image models.arXiv preprint arXiv:2401.08541, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.354253Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:049be0232710364eb169ca52de1ebca3d63e871e6f8945218cced61fbcd8a8ef","observation_id":"a87c79cf-73ab-4575-9598-d4760d41a977","resolution":{"observed_at":"2026-08-06T20:38:53.354253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.480462Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"b4e3f42c-9b04-47df-b235-49a90e27978f","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.446728Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ef10210309279b23c81eb648adbc218ebad18b7887532897c93ac15a8586eb52","observation_id":"68e48bbf-9dd6-42d0-966e-7733573e78bb","resolution":{"observed_at":"2026-08-06T20:39:03.570862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.343288Z","title":"Bard, 2023","venue":null,"work_id":"23ea8455-0979-4e98-ba1b-089eb7937942","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.561406Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0dfea5556ff70780573dcd7463b515e47e6f7814388629a70ceaf8890fa7cfb3","observation_id":"252b5d1f-2fa6-44ba-9913-5a91f4bbdfc1","resolution":{"observed_at":"2026-08-06T20:39:03.405061Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.229436Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"022d35ad-9452-4c1a-9d4b-8f06e3b27e99","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.652716Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:12c07496696439e59a3ca10e3f81f48195227ed5f580135a5e116daf4eb9d62e","observation_id":"5dd010f8-adac-42a8-8a97-432f3f39ae80","resolution":{"observed_at":"2026-08-06T20:39:03.279659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:03.033766Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"59ce0c6b-a653-4d5d-9739-a075bdecf824","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.798678Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:dd804fa9e676963a255d4f663293b0ff699569406a0103ae8b93eef98f70a6bc","observation_id":"6ff93a87-2e27-4d7c-8415-f1dfc9127758","resolution":{"observed_at":"2026-08-06T20:39:03.116615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T20:38:53.883035Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.883035Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a8f99081df2ba5f3eb781d25a65d6939f82b26cac485332c44d616ba9388b3ad","observation_id":"bf617df7-6a61-4783-a33b-30d5a1518c0c","resolution":{"observed_at":"2026-08-06T20:38:53.883035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:53.982040Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:53.982040Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:687d193ba576cd65b9ff38ac664a4e52717019ec63e04e23250f7d2f1ace2c2a","observation_id":"a6ad18ef-808a-4947-a520-9ace8aef4962","resolution":{"observed_at":"2026-08-06T20:38:53.982040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T20:38:54.116873Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.116873Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:221ae71a487765d3e8cd85d2a6f35465ea557eeb6c629d1bd5af540b859649bc","observation_id":"0eb50e1d-dcee-40e5-995b-2fcdf09fe20d","resolution":{"observed_at":"2026-08-06T20:38:54.116873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.859247Z","title":"Cascaded diffu- sion models for high fidelity image generation","venue":null,"work_id":"e59a4d11-a1ac-4a6f-b0b1-2a8fe9e97439","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.213500Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a4a001df708524ff7ef07d046f7a7442d9804d1528554869bcf10e93bf41a2e7","observation_id":"8804c6a8-a0b1-484b-b985-8ff63bf3a477","resolution":{"observed_at":"2026-08-06T20:39:02.919211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:54.332729Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.332729Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a02f91908b097b6b915719f5b061f6aa35822225e020ac0c3b525e2c2ab5d9a6","observation_id":"d2c84141-fda2-44a5-bfc2-43702f3540a6","resolution":{"observed_at":"2026-08-06T20:38:54.332729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.649037Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":"29f98a33-3e1f-4d1c-aded-bbfd5e711863","year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.441576Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:f38d9379d9a1a2de3eec6a97032eecdba96f262506e9ae67347a816a8e6dffc3","observation_id":"f0cf46fe-5814-49b2-9866-2f7da5f4680e","resolution":{"observed_at":"2026-08-06T20:39:02.737625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:38:54.576078Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.576078Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:6484585d7e5dc5851ce901973e4af53a68f48c9e85e601c5bc2f3a50661dfc0a","observation_id":"ea571856-f4ef-4846-aea3-f5a4519b682b","resolution":{"observed_at":"2026-08-06T20:38:54.576078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T20:38:54.639643Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.639643Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0b7df3da3f934ab684b85a1445f276e1a4b9d921af98656634cbfbe9c50ef3b1","observation_id":"6133d91a-e062-42ed-9223-0c70b3434c7f","resolution":{"observed_at":"2026-08-06T20:38:54.639643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.495129Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"35074aa8-5146-4e72-b20d-b1b1896de438","year":1956},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.771727Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3aedc054d0b7af8fe46a272a68a6103b2c5244987b3e7e54047b916469935d0a","observation_id":"194bf243-bd23-4617-b4c0-cb48ff39a332","resolution":{"observed_at":"2026-08-06T20:39:02.560207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.294993Z","title":"Improved precision and recall met- ric for assessing generative models","venue":null,"work_id":"eda9a3ec-ca3a-48d6-b516-0064bedb954a","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.860245Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:8648467accf6dfd3ec9ee2a6d1d242b10d44c283a39e0e318e84b460766a37ec","observation_id":"e95f4f2a-e9be-40b6-96a6-bc5de225b262","resolution":{"observed_at":"2026-08-06T20:39:02.381655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:02.103281Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"5688ddd4-8f88-4bc7-aedb-39c0d2d09250","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:54.984525Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:345777b3843a0b355f6b3d916898d66b6670d350321b417e6027eb1b5421f06a","observation_id":"8f3074bb-2efe-4a84-bc4c-07648556f66e","resolution":{"observed_at":"2026-08-06T20:39:02.195683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-06T20:38:55.067070Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.067070Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:952e792ed2ceb3172688b6f2b60ea777fb0946f92f2255ed5dcaf8497d562517","observation_id":"11f53f2a-9ad8-48f1-b5bc-c20e4fc7800d","resolution":{"observed_at":"2026-08-06T20:38:55.067070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.885411Z","title":"Can ood object detectors learn from founda- tion models? In European Conference on Computer Vision, pages 213–231","venue":null,"work_id":"a34b213a-a15e-44f4-bde1-e5e51c36daeb","year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.189327Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:483bcca53bf50a9a7a1e224968179bf027b9e06a01381fa89383006961ec9b7a","observation_id":"0e5809fd-d78d-4b70-be8e-134b593f4b10","resolution":{"observed_at":"2026-08-06T20:39:01.981059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T20:38:55.296352Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.296352Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:7dd2a56f7d8022023bd0352438d36df62f2e7709c29f2f6c00b31ad3f0d36382","observation_id":"fcfe8a77-6e6f-4450-9185-deafc84b21d6","resolution":{"observed_at":"2026-08-06T20:38:55.296352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T20:38:55.373481Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.373481Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:20439d9653ff5291029ad39deba623220b81502fe21d724d2f2948a103c6fe8f","observation_id":"8697f5c9-d9f9-4162-b67a-3a4eea8a129b","resolution":{"observed_at":"2026-08-06T20:38:55.373481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.692268Z","title":"Chatgpt, 2022","venue":null,"work_id":"819c9be5-3c16-4d72-8f98-8f0521c8f0ae","year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.485713Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:b7ea66b960d2b957b77adfa20a1c546adf7cb767ef3c0a09f8810d07f7309de5","observation_id":"84cfb75a-522f-4625-97cc-245a98ad51c1","resolution":{"observed_at":"2026-08-06T20:39:01.779476Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:55.572145Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.572145Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:376e3358c53381bfb8b6fca5612bc00668a65ca825de4e3f5accaf8d2923174a","observation_id":"8c5d375c-8c99-42c1-b5c6-8232315e88b9","resolution":{"observed_at":"2026-08-06T20:38:55.572145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T20:38:55.676762Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.676762Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3cd8d8d7b5fb6e5428aab17a5c27f0bd0f0fe0e9b033d415a1df83b51368cbc3","observation_id":"f482462e-5fb0-44ca-a291-2cf43e445166","resolution":{"observed_at":"2026-08-06T20:38:55.676762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.483969Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"1ccfe290-1777-4105-9cee-e66d3c7bc3a0","year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.785083Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:d733fb0313c67e16572c8e58c55c6d487d0e63fd1a3e56dc9d80d6d38c3a9bf4","observation_id":"c024bb86-250e-42fe-a37f-64b4dfd20df0","resolution":{"observed_at":"2026-08-06T20:39:01.566593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:55.863780Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.863780Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:b9b5e382c1e97b35971596965f65cd92f3684fc8781080808756290ef640e7c5","observation_id":"90550810-4507-42c6-a770-02899ca4494b","resolution":{"observed_at":"2026-08-06T20:38:55.863780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.223146Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"dfd4d5df-dbaf-4f9d-ab83-29b4465a4c19","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:55.940722Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:83d58b8d222b49241c02dca508edbb9ddeeb4aad392edf642871d900a9ce44d5","observation_id":"8b9b47ee-d9c0-4903-ba2e-f53a6e33b937","resolution":{"observed_at":"2026-08-06T20:39:01.390968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:01.035681Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"5c8ecd39-35a2-46f4-8ab5-7195e8adbbe0","year":2020},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.069853Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ed975c60caba8e937ffb87607d87ae41a7ab134e9be3c34277fe63f9579a343d","observation_id":"61f741a3-8025-4b0b-88b7-84bdd609e747","resolution":{"observed_at":"2026-08-06T20:39:01.119501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:56.131220Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.131220Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:1537f9d76eac4ee79183b66f19425b15565762d4a8c031d100b63d86e798d644","observation_id":"da487f64-e186-4b8c-8bc5-a8a5b7a4b60b","resolution":{"observed_at":"2026-08-06T20:38:56.131220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.843750Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"03e25894-e075-4405-a1fb-7f0098d34d02","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.230436Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:055b5c994b2f5c761db895fb89a216cbbb5872494e95d539b7aa01b532b8e506","observation_id":"596ddcf9-5829-46db-a754-a5a015f633fe","resolution":{"observed_at":"2026-08-06T20:39:00.945484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.630309Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"af041d81-a262-4b18-b1bc-99ef42f7b5ab","year":2019},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.318130Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:bff3eea4b9bc68a4d9dd9456a9e45d8ffcd1bbb6a2eafe91ae04a57014ed7615","observation_id":"1bd6eaa0-930d-478b-989c-6d5b7ce36292","resolution":{"observed_at":"2026-08-06T20:39:00.739219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.438182Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"818a4c7a-cf8a-48a5-bb04-3a366420c918","year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.406666Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:467d699dfed4a6f8734cbb55ba0323a9f2bd058441a5c2a1a7a3fd8ab4c24e56","observation_id":"716eab44-9570-4f39-8a05-ff68bd8e2df2","resolution":{"observed_at":"2026-08-06T20:39:00.542257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.231427Z","title":"Improved techniques for training gans","venue":null,"work_id":"6153a407-5418-479f-b0d2-e54f60b627cc","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.493251Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:5f0ce5bb9e96d71cca671004137d2d082d726836a25306236d3a470ea4faf27d","observation_id":"085de32d-4c83-431f-96b6-1d17a61a6e54","resolution":{"observed_at":"2026-08-06T20:39:00.300853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:00.048447Z","title":"Scaling stylegan to large diverse datasets","venue":null,"work_id":"d9fadf4b-5861-423a-a689-80a200724321","year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.589420Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ad843895f2b14cb2d355ff731dfb2bef5a974e1546918a90e0b411901362491b","observation_id":"5207939e-56c9-4e37-8936-00aa2188182d","resolution":{"observed_at":"2026-08-06T20:39:00.137125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:38:56.675293Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.675293Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:24171b5564394b8e19f138bd6b15df6a22a4e7c8c25264aa7ef603b9835aff55","observation_id":"e4580822-a7f2-4966-b05a-8706305df4d9","resolution":{"observed_at":"2026-08-06T20:38:56.675293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:56.787379Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.787379Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:bb67a6412c32b92d1e3575cbfa08f60fdf66d1d75d133a26254b804702cf4f0a","observation_id":"cae115fe-7b40-4e33-ba1e-c0e49869ebf3","resolution":{"observed_at":"2026-08-06T20:38:56.787379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T20:38:56.919368Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:56.919368Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:d0b9f1f0741ce70c43b5f8f32aa6c7e5ab4e5b37507f49090215962e62f5aa39","observation_id":"d123d1e1-29a5-4d51-9fb2-57ab8efe9b44","resolution":{"observed_at":"2026-08-06T20:38:56.919368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:38:57.032639Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.032639Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:aa1070d987008aad6f7bfc29b2a00a5a7d22b51035cea9fd0c9b28150dd9fe16","observation_id":"0545d7ab-e8ab-4af0-aa92-0f0e0a056a55","resolution":{"observed_at":"2026-08-06T20:38:57.032639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:38:57.164384Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.164384Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:0fcecd42497aa468d8a6ee336a4f69237567572211931f4b47dacf85ec452c0a","observation_id":"f5f598eb-b3e3-4524-b662-14dcfddad4be","resolution":{"observed_at":"2026-08-06T20:38:57.164384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.816152Z","title":"Conditional image genera- tion with pixelcnn decoders","venue":null,"work_id":"a4e5bb5a-ac23-4e0e-b061-f2a703fdf5a1","year":2016},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.282355Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:9f694d47a873a051dbfa46e295919aa4ecdb0189f14cec764231dee668e748a0","observation_id":"36fb175c-1dd8-4393-9906-a66607c977e2","resolution":{"observed_at":"2026-08-06T20:38:59.941319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.612924Z","title":"Neural discrete representation learning","venue":null,"work_id":"77090269-681d-4cc0-9288-a23ff86ea0e0","year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.409657Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:07906e8379816396e9f20549b35135ed46f57318afa3bee68499eef53d9d23d3","observation_id":"34d65770-90a1-42b0-868e-139725bf6c31","resolution":{"observed_at":"2026-08-06T20:38:59.720741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:57.522886Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.522886Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:8806322e45ca512cbed7acded501983cbd9b336613f6f02ef5eeea3db86be449","observation_id":"c038c626-54e8-47ef-a726-6173a8b43b78","resolution":{"observed_at":"2026-08-06T20:38:57.522886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:59.407905Z","title":"Recon- structive visual instruction tuning","venue":null,"work_id":"4e30c0e5-bc26-43e1-ae21-94ce75a3caf3","year":2025},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.678701Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:91d30f2f3b800c1810c2e0e724d9def52d860242259d2d5e32a677e0fe88dff8","observation_id":"ea5a5c3b-0972-4db0-ab9a-265f5817e67e","resolution":{"observed_at":"2026-08-06T20:38:59.508204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T20:38:57.803144Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.803144Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:c590cbb0645c8e9cf9bedd33c71af8cbf75a8c9926ffb96981043eaa80e8b78a","observation_id":"0786b244-b449-42fc-9241-b9291128dd20","resolution":{"observed_at":"2026-08-06T20:38:57.803144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T20:38:58.028490Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.028490Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:74e2e3a852c38d6aa14616e296c60bbea074af496565d77471a4d18a72016933","observation_id":"89feb30a-2973-4832-8d8c-fdecdfb6844b","resolution":{"observed_at":"2026-08-06T20:38:58.028490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T20:38:58.143921Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.143921Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:e043cfe2deb6fed3d1cb1610a9e268b6cebfcba589308c1511306b0f95b6838d","observation_id":"efce1fec-01bf-4eb8-b361-4439f5f9c537","resolution":{"observed_at":"2026-08-06T20:38:58.143921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.299612Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.299612Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:3c7a6da43916ee0bb139703d337324aed8480eaf5683237aef32d68627d23855","observation_id":"fcfd4529-befd-47c1-a6ec-8b0119b5a0d2","resolution":{"observed_at":"2026-08-06T20:38:58.299612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T20:38:58.432446Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.432446Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:a6186e3f716d304e03163ba5147a43f1fb8a337baa564458832f28fe8b17d4fb","observation_id":"d1a0d0b0-9707-4e2b-8678-e2f9d0d1584b","resolution":{"observed_at":"2026-08-06T20:38:58.432446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-06T20:38:58.541916Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.541916Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:ea7feb032a5714e883b786abf512a499f65f5521edfb9faf06fa4d59e5ad41e4","observation_id":"4b2fd8ff-3c60-4015-bbfc-aa3e9bcfd79f","resolution":{"observed_at":"2026-08-06T20:38:58.541916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.654597Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.654597Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:baafe0ad5980715b55891866a319c4c80edb5cc3d25740372224aa59a0d4b678","observation_id":"712c362b-dd7b-4bea-9a69-564876f8923d","resolution":{"observed_at":"2026-08-06T20:38:58.654597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T20:38:58.785878Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.785878Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:009a555fd8352847bd2d66bdd6d887ab1e98b1ca8c966a9655f9904f08022385","observation_id":"05fc0137-ac8e-43b0-a1ef-80a6319e9a43","resolution":{"observed_at":"2026-08-06T20:38:58.785878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:58.888409Z","title":"Movq: Modulating quantized vectors for high- fidelity image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:58.888409Z"},"links":{"citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:f38b4d5e70f4eae537fd5e7bcb96fe3bc9a67710832a1455dffc516aa48fd5c0","observation_id":"ed2c56b1-8b6e-4b80-9ec4-5b1d9e66cd5e","resolution":{"observed_at":"2026-08-06T20:38:58.888409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-06T20:38:59.016813Z","title":"Scaling the codebook size of vqgan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:59.016813Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:040c46b2ba01bbb6216fcb744784240ff2bc942104223d56466af5d5a52a72a2","observation_id":"3c5cddd5-da6d-4fec-a0e4-672898b727ba","resolution":{"observed_at":"2026-08-06T20:38:59.016813Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":34,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 5 inbound Pith citation observations for arXiv:2507.02358."}