{"as_of":"2026-08-11T07:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6a64f0011df62cba99a8b7ff36765e1671eada3924b594696813b784680473b","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:44.078464Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:40:31.721604Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.125374Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-08-10T13:40:31.721604Z","title":"Shen, S., Yao, Z., Li, C., Darrell, T., Keutzer, K., and He, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16295","last_updated":"2025-01-27T18:35:05Z","snapshot_observed_at":"2026-08-11T06:47:53.789212Z","submitted_at":"2025-01-27T18:35:05Z","title":"Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T13:40:31.721604Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2501.16295"},"observation_digest":"sha256:1aae27fac40b5f68d8c9ef2f58f6679e0bddc8170f6ce3eb516df97298361d69","observation_id":"2576ec84-5f26-41ae-942b-d852836e6f68","resolution":{"observed_at":"2026-08-10T13:40:31.721604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-08-07T05:27:50.047548Z","title":"Cat: Content-adaptive image tokenization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.047548Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:2ed551fe9a93c18242708577bb2929d3318ddbe3d4bf8ef05b5837651fa3e0c6","observation_id":"210c2e1d-ef26-42b9-b227-58920dcdad78","resolution":{"observed_at":"2026-08-07T05:27:50.047548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-08-06T18:35:33.082701Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07995","last_updated":"2025-07-10T17:59:53Z","snapshot_observed_at":"2026-08-10T08:25:29.929743Z","submitted_at":"2025-07-10T17:59:53Z","title":"Single-pass Adaptive Image Tokenization for Minimum Program Search","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:35:33.082701Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2507.07995"},"observation_digest":"sha256:34692798f76b02c7eac2fbc41b7a8f1a1695f39d35e125273e332705189e33f7","observation_id":"137f9ba6-5214-4a0e-bdc3-03c13c767b3d","resolution":{"observed_at":"2026-08-06T18:35:33.082701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2604.09168","last_updated":"2026-07-23T07:42:32Z","snapshot_observed_at":"2026-08-06T11:01:30.223629Z","submitted_at":"2026-04-10T09:53:27Z","title":"ELT: Elastic Looped Transformers for Visual Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T17:19:22.543462Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2604.09168"},"observation_digest":"sha256:6ae33765ac718e2d4c43e7e07168e69d35964d4bacdc7ee24d333116813dbfd3","observation_id":"4b4406d8-d1a8-4cd8-8cba-9d22786eba8c","resolution":{"observed_at":"2026-05-11T07:05:59.720179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-08-02T16:35:03.359155Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09168","last_updated":"2026-07-23T07:42:32Z","snapshot_observed_at":"2026-08-06T11:01:30.223629Z","submitted_at":"2026-04-10T09:53:27Z","title":"ELT: Elastic Looped Transformers for Visual Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T16:35:03.359155Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2604.09168"},"observation_digest":"sha256:8349534dac7f360a1f7b98bea82666fb81151d8811fce42eefde676b085effd9","observation_id":"a736e1d1-5aff-4191-abeb-c193a8ce2685","resolution":{"observed_at":"2026-08-02T16:35:03.359155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2605.07915","last_updated":"2026-05-08T15:52:51Z","snapshot_observed_at":"2026-08-02T05:37:32.685801Z","submitted_at":"2026-05-08T15:52:51Z","title":"What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:24.033068Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2605.07915"},"observation_digest":"sha256:4e69c291fb07de82c8a9f9bca6ed469f89c108886796ff0a736bb82b2b14b890","observation_id":"89064129-f04b-44c7-bcbb-460641706b8f","resolution":{"observed_at":"2026-05-11T04:05:56.961107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2605.27696","last_updated":"2026-05-28T13:12:21Z","snapshot_observed_at":"2026-07-06T23:37:21.716437Z","submitted_at":"2026-05-26T21:16:04Z","title":"Structure over Pixels: Learning Variable-Length Visual Programs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:06:01.684713Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2605.27696"},"observation_digest":"sha256:61ac234b600a7e52f07aa8e74ad0bf9c27b757f3de4eca95f0e8e9e946588363","observation_id":"f3dc957b-47c9-449a-a4fd-2019ef76f92d","resolution":{"observed_at":"2026-06-29T18:13:49.017325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:0ff82aec0bff1ea18e8b66e49b16a40878e9d0457e5f46b037ed755bf661dd60","observation_id":"c54db9eb-1bd2-49ff-86e5-56f4e01bc11c","resolution":{"observed_at":"2026-07-02T02:36:27.682885Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2606.04461","last_updated":"2026-06-03T05:10:51Z","snapshot_observed_at":"2026-08-06T16:03:42.037175Z","submitted_at":"2026-06-03T05:10:51Z","title":"ChannelTok: Efficient Flexible-Length Vision Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T07:09:25.049534Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2606.04461"},"observation_digest":"sha256:6a7d60296391cf29dab2f505f79adf3f0566629c97101ab8050e418c1eb6e41d","observation_id":"f175b7d2-8800-4d82-9c6d-55d93195bfcb","resolution":{"observed_at":"2026-07-02T07:06:44.300147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"cited_work":{"arxiv_id":"2501.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03120","snapshot_observed_at":"2026-07-02T16:27:09.125374Z","title":"Cat: Content-adaptive image tokenization","venue":null,"work_id":"d4014e26-de08-410d-b3ab-471df3ad3db0","year":2025},"citing_paper":{"arxiv_id":"2606.07185","last_updated":"2026-06-05T11:49:28Z","snapshot_observed_at":"2026-08-09T16:35:02.841511Z","submitted_at":"2026-06-05T11:49:28Z","title":"AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T22:43:09.489524Z"},"links":{"cited_paper":"/paper/2501.03120","citing_paper":"/paper/2606.07185"},"observation_digest":"sha256:ed6e28638b86aa1b22401a37bd287877ad2ab10f0523259b477d917fe9cc4c68","observation_id":"5120ffbd-936e-4178-a2fc-03f2f3d8bfdc","resolution":{"observed_at":"2026-07-02T16:27:09.126598Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03120/citation-record","integrity":"/paper/2501.03120/integrity","json":"/paper/2501.03120/citation-record.json","paper":"/paper/2501.03120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.423015Z","title":"Taming transformers for high-resolution image synthesis, 2020","venue":null,"work_id":"ff8dabb4-08fa-46d9-9540-791e3998f355","year":2020},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.689710Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:fb227b12ece7d4d7bed5a0670e404cc738562bf8a420b9f2d347b88ea099828e","observation_id":"fba74c6f-75aa-4b04-b0dd-a0ca4af632f7","resolution":{"observed_at":"2026-08-10T21:56:45.427876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.406350Z","title":"Auto-encoding varia- tional bayes, 2014","venue":null,"work_id":"bff4d100-5acf-4b82-9ed6-21551663ead3","year":2014},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.695604Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:732ce83f82637395848566092d501a3cd7e8b82429f0266800c36a25e66ab33a","observation_id":"4725b149-478e-4adc-9fec-e3b74a11a2ce","resolution":{"observed_at":"2026-08-10T21:56:45.412447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-10T21:56:43.700330Z","title":"Gundavarapu, Luca Ver- sari, Kihyuk Sohn, David Minnen, Yong Cheng, Vigh- nesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.700330Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:170eb0767f1719602040efde2fe4ff28127cb8cd6c643b22cd65ff4561476239","observation_id":"dd810094-b9a9-48ab-9b37-cdb4fd279304","resolution":{"observed_at":"2026-08-10T21:56:43.700330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-10T21:56:43.706541Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.706541Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:b40f1c40a62746f27b653051e62e8210303400283d6e22fe15b73db76d8bdc31","observation_id":"9a6736b3-2c50-438f-bb63-3ebea2875677","resolution":{"observed_at":"2026-08-10T21:56:43.706541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.383157Z","title":"Ef- ficient architecture search for diverse tasks","venue":null,"work_id":"3893c8a4-aeae-498c-badd-a489ff3a3159","year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.712020Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d69f4cffe046a2e14c19c80ee8fdcb1ab96f40d37ca70b3c28afebf8e60d37c8","observation_id":"0bd6685d-fa90-49b4-9572-c410e31c0eab","resolution":{"observed_at":"2026-08-10T21:56:45.390932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.365748Z","title":"NAS-bench- 360: Benchmarking neural architecture search on diverse tasks","venue":null,"work_id":"4a3a6b9d-b4e4-4031-b9af-8d0b24780540","year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.717112Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:1da76302b2796bfc2129026741102ebf8dce9648468e2811ce20a8f48781ff57","observation_id":"896fba71-a58a-4cc7-90c8-44ef6990e0f5","resolution":{"observed_at":"2026-08-10T21:56:45.371391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.348389Z","title":"Finite scalar quantization: Vq-vae made simple, 2023","venue":null,"work_id":"486dd02f-8406-4d09-9dc6-ab8688a9b101","year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.723475Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:093be6d5bb8f42a2f9e974302f7b9065dff0a266c8d251ddecb3033f51041e89","observation_id":"ddf4e365-e1bb-4967-8416-b5a05a6230ab","resolution":{"observed_at":"2026-08-10T21:56:45.353504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:43.730493Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.730493Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:2a7e9ccd2ad37dfa170362a4bfa0696cc3560cadc34a8bff3755d09d4c705cec","observation_id":"32c73fe9-d893-4df8-976c-c96a3df6129b","resolution":{"observed_at":"2026-08-10T21:56:43.730493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-10T21:56:43.736539Z","title":"Lawrence Zitnick, and Piotr Doll ´ar","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.736539Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:40ff35fb3710e2c33b05b3ddf2bf413ec842e67a3a819c9f7bdf33fe825591df","observation_id":"1d5351c5-a6aa-48f7-916a-d24f36b6382d","resolution":{"observed_at":"2026-08-10T21:56:43.736539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.331860Z","title":"Elastictok: Adaptive tok- enization for image and video","venue":null,"work_id":"b0e5cf14-3713-4e67-8701-de580d38dbdf","year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.742114Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:3f08abeb1d69f1c78ed2b33dc2e0bcdef6debb87cefcb21a14d718d55919e16b","observation_id":"44d9325b-cc09-42d4-b80f-6c48ff8630e9","resolution":{"observed_at":"2026-08-10T21:56:45.336847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.313439Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"8f1cbd6f-0184-4847-a267-148ca74fbe93","year":2021},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.747565Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d4024afd4b958b127d8c31632ce75bd8f1ce1c3d98aec3b826248647fca9c140","observation_id":"cc3aacd2-6da8-4fbe-9d53-9e99d0f1738d","resolution":{"observed_at":"2026-08-10T21:56:45.320394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.294647Z","title":null,"venue":null,"work_id":"bdc71d2b-6854-4687-b288-5b61afadc538","year":2009},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.753319Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:8baa295dfe558fa5e52a6ff7f9a4ba19cff59cd2cd0804ffb347835a101a544a","observation_id":"71633840-d5d7-4b0b-8508-c822581fddcd","resolution":{"observed_at":"2026-08-10T21:56:45.299938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.275299Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"fb32ac95-1967-4b2b-b6a1-a8065b432f27","year":2015},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.759208Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d23a7c76c4e761670bf548da3a38d94f76dd1071a23750b385354dd7f1c13412","observation_id":"e95c0177-880d-4806-a223-da1d339fbcf0","resolution":{"observed_at":"2026-08-10T21:56:45.280170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T21:56:43.763638Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.763638Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:c116cafa7b9145a40f813740847dfbb6c132d21191f7c00b710f2be31dd724bb","observation_id":"52db2009-5ed6-44c9-b1cf-0a3e1c2dc416","resolution":{"observed_at":"2026-08-10T21:56:43.763638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T21:56:43.769440Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.769440Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:801304e0a13907f17e6f3bcdb4c971828b1740f8850fd4f71313004fa2cd552e","observation_id":"dbb5b620-ce94-4cd0-9919-cfbb6f347642","resolution":{"observed_at":"2026-08-10T21:56:43.769440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-01T14:58:21.912263Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-10T21:56:43.775234Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.775234Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:7ce91c12ab509fd455773ffeb5e5f9fcc88b722a390409ad876d614a2cf4148d","observation_id":"08467109-edb7-43a4-bbc7-77e24a972a6d","resolution":{"observed_at":"2026-08-10T21:56:43.775234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:43.780669Z","title":"Wiegand, G.J","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.780669Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:984678dabfa7030230ca84f08fb0d25827ff1905de88ff63358b9b4c027e8d13","observation_id":"9f10eda1-0f24-4e72-9db5-b94306916a66","resolution":{"observed_at":"2026-08-10T21:56:43.780669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:56:43.788229Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.788229Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:03dd5db8d5aa9ed3e4e588f02d431e258c18e2c262669e1015bcedd98e702042","observation_id":"4c416156-83d0-4f8b-8e6c-e8fc60c9e4d7","resolution":{"observed_at":"2026-08-10T21:56:43.788229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.259280Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"1fe3b75c-bc25-4c83-aa7f-cc48b50d3825","year":2021},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.794553Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:906cb2651063cea85e3b346764471af3c107a3fed5768a3e8471364d7c2d636e","observation_id":"b82361eb-cca7-459c-a7ad-1fa8badf29aa","resolution":{"observed_at":"2026-08-10T21:56:45.264194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.241682Z","title":"A-ViT: Adaptive tokens for ef- ficient vision transformer","venue":null,"work_id":"96274d52-6548-4761-b3ba-4a7f93c9b492","year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.799289Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:fd798fba9f64389f5f090cfff801ebcdea073c26e53beaea0fe45174086ac412","observation_id":"a349ef33-4d8c-44df-948b-553ecbaa1836","resolution":{"observed_at":"2026-08-10T21:56:45.247519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.222393Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"ec9c1b2b-f986-4247-8ecc-d7d222cf0efa","year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.804638Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:52a416e193f015128b90a7d42ff136dc8e801062adbf14edd9c166eb04f53794","observation_id":"be924f65-5cc6-44a3-8bbe-d7414449e67e","resolution":{"observed_at":"2026-08-10T21:56:45.228133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08451","last_updated":"2023-08-28T10:22:23Z","snapshot_observed_at":"2026-08-11T04:46:35.929437Z","submitted_at":"2023-04-17T17:21:21Z","title":"Efficient Video Action Detection with Token Dropout and Context Refinement","version":3},"cited_work":{"arxiv_id":"2304.08451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.08451","snapshot_observed_at":"2026-08-10T21:56:44.570251Z","title":"Efficient Video Action Detection with Token Dropout and Context Refinement","venue":"cs.CV","work_id":"0c2c7a2b-0b4e-4f07-bcf0-ede6ac2b7f43","year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.810944Z"},"links":{"cited_paper":"/paper/2304.08451","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:4fd1599a3d9f877ffeb676f3808a4f6f4fc67247822d36704847d7480f565a86","observation_id":"ab99dc1b-fc35-4e26-ac69-b7c9a6d17209","resolution":{"observed_at":"2026-08-10T21:56:44.576444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00287","last_updated":"2023-04-27T13:16:38Z","snapshot_observed_at":"2026-08-10T08:56:29.689515Z","submitted_at":"2023-04-01T10:39:46Z","title":"Vision Transformers with Mixed-Resolution Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00287","snapshot_observed_at":"2026-08-10T21:56:43.816592Z","title":"Vision trans- formers with mixed-resolution tokenization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.816592Z"},"links":{"cited_paper":"/paper/2304.00287","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:79d37987cc378ab9f8c4b9c50eeb79deb185d9a0fe19137b54df4ed4e61fcd55","observation_id":"5344084a-1c81-409f-84ca-60a6f79cc2ad","resolution":{"observed_at":"2026-08-10T21:56:43.816592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02393","last_updated":"2024-11-04T18:58:01Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T18:58:01Z","title":"Adaptive Length Image Tokenization via Recurrent Allocation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02393","snapshot_observed_at":"2026-08-10T21:56:43.822118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.822118Z"},"links":{"cited_paper":"/paper/2411.02393","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:c99c2747dd19874aa42b3b3c29357c1ab969a96de842e113f9de4aa598ac96e3","observation_id":"ef7c60dc-0343-4f08-8515-8c61c6bb7465","resolution":{"observed_at":"2026-08-10T21:56:43.822118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:43.827416Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.827416Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:bf26d7d27102926fd9a2746ed23d85d5a05b467910f98f66d2d043221562dbbb","observation_id":"689ad22b-5d7e-4741-af9e-31fe713bdab4","resolution":{"observed_at":"2026-08-10T21:56:43.827416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.190942Z","title":"Matryoshka representation learning","venue":null,"work_id":"fd47acad-9c93-4fed-ba9e-132d754fc4ff","year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.837435Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:9e9f46144857670cfa5d11021ec8df255cbca2495770bf81082787e0fe0edafd","observation_id":"8ccfce6c-8771-465d-afe4-328015104a91","resolution":{"observed_at":"2026-08-10T21:56:45.196223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-10T13:02:49.707705Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-10T21:56:43.843091Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.843091Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:a7821e72ce81f0b750319d05ddcbca30ca6a17d3fe303e3bf5ef76cbd7c2e66e","observation_id":"581fada8-fa52-4455-843f-056e138f6073","resolution":{"observed_at":"2026-08-10T21:56:43.843091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15111","last_updated":"2024-08-30T19:21:36Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:20:01Z","title":"Matryoshka Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15111","snapshot_observed_at":"2026-08-10T21:56:43.848801Z","title":"Matryoshka diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.848801Z"},"links":{"cited_paper":"/paper/2310.15111","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:3d9898758395380ca598033462ea9c0c20e445bc31baf0eacddc1fa23b23f54f","observation_id":"b09b575b-26b8-43a6-871f-1828ae6cedcb","resolution":{"observed_at":"2026-08-10T21:56:43.848801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09494","last_updated":"2022-05-09T17:02:49Z","snapshot_observed_at":"2026-07-06T12:49:14.981089Z","submitted_at":"2022-03-17T17:48:32Z","title":"Transframer: Arbitrary Frame Prediction with Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09494","snapshot_observed_at":"2026-08-10T21:56:43.855083Z","title":"Transframer: Arbitrary frame prediction with generative models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.855083Z"},"links":{"cited_paper":"/paper/2203.09494","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:40adaea9e4a69fe9d2f2c0a0bc275107c95f390ab11c1c1352a74305d2dfe082","observation_id":"dd3c8177-7d31-47c3-954a-81284f1f1d09","resolution":{"observed_at":"2026-08-10T21:56:43.855083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.173340Z","title":"Matryoshka query trans- former for large vision-language models, 2024","venue":null,"work_id":"831c5980-fe40-4aa1-b227-73ab935aea31","year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.862153Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:bc1f997a67ede19d23c98f44b6a4811b23016f8eea9e226f34ba45a33f61f115","observation_id":"f608f7d0-3e62-41e8-a237-5013c93dca0a","resolution":{"observed_at":"2026-08-10T21:56:45.178890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.152608Z","title":"Dery, Corey Staten, Mikhail Khodak, Graham Neubig, and Ameet Talwalkar","venue":null,"work_id":"16091310-acff-42f7-afdd-70eb60dfa34f","year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.868549Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:895bdb9aeccdbfa3039ae3bb1b9d17c39c5df77203d31b2dff1a18e288913c9a","observation_id":"245738a3-97b5-44bd-8c97-15d191d4718a","resolution":{"observed_at":"2026-08-10T21:56:45.159011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07187","last_updated":"2024-11-23T16:39:43Z","snapshot_observed_at":"2026-08-06T23:01:00.370154Z","submitted_at":"2024-03-11T22:00:39Z","title":"UPS: Efficiently Building Foundation Models for PDE Solving via Cross-Modal Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07187","snapshot_observed_at":"2026-08-10T21:56:43.874099Z","title":"Ups: Towards foundation models for pde solving via cross-modal adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.874099Z"},"links":{"cited_paper":"/paper/2403.07187","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:4c36566fdf73f570d32d8c54071064903297cf00ac193f4b203cf1d11eb6b2cd","observation_id":"1354c351-fba5-4c91-8e9c-04717aa0c30d","resolution":{"observed_at":"2026-08-10T21:56:43.874099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.133916Z","title":null,"venue":null,"work_id":"f21dce11-6ce5-4f9c-a3e4-350c477bd578","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.879443Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:8dc7d5bf7395042c4e613b441603b668d56c11c4ff4b665eded2511b3c35bf36","observation_id":"1fae709b-1b15-4bd2-8b23-0839c73809e9","resolution":{"observed_at":"2026-08-10T21:56:45.139044Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.100359Z","title":"Tag-llm: Repurposing general-purpose llms for specialized domains, 2024","venue":null,"work_id":"e889814e-131a-442c-8de5-8b7261d51e57","year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.894397Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:6005cc11f81d000e270324d1fc41e6aa7a04ebc72b709e1fc8ec2cb1cca18a40","observation_id":"c13d75c8-dd44-437e-a40d-2ac453a53c5e","resolution":{"observed_at":"2026-08-10T21:56:45.105877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.080160Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"fc1f7934-6a04-49ad-bd85-fc80fb3c6813","year":2018},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.899667Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:56dc66f8d0714103c6457b0926e2704447794dc0bf18d3bad78be074653897c0","observation_id":"18ea68a4-7a83-444a-965f-577352024f44","resolution":{"observed_at":"2026-08-10T21:56:45.086950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T21:56:43.905291Z","title":"Very deep con- volutional networks for large-scale image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.905291Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:53f086db791a09c851f90fa2ca61b84d817972b5f0c731eba3f312619a2b1bd5","observation_id":"b1abc578-9062-4ae9-844c-f1961c2b6ad1","resolution":{"observed_at":"2026-08-10T21:56:43.905291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:43.911041Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.911041Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:c970d970e60d175867e29557ee7e359afe6f6d283d38920b5b0bcdb44536ee66","observation_id":"a78100ea-4bc6-4df2-8ecd-067a982deb1e","resolution":{"observed_at":"2026-08-10T21:56:43.911041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T21:56:43.923167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.923167Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:c53e150ac88722b286130f833165acde34aae3c2270243e0163f72fa1c5e34aa","observation_id":"aa065f64-0b2f-4533-a846-f0149a060ec1","resolution":{"observed_at":"2026-08-10T21:56:43.923167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-10T21:56:43.928836Z","title":"Deep residual learning for image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.928836Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:ef4dd87c3ae96f4ca73830f0965b80d7ddcf186e9d8a978b17a53c7fcc038e7c","observation_id":"836c873a-a8c0-4e7d-9de5-f6b959ab23b9","resolution":{"observed_at":"2026-08-10T21:56:43.928836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-10T21:56:43.934729Z","title":"Momentum contrast for unsupervised visual rep- resentation learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.934729Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:b6e2374581554b8579cd8fa3a6be5e0353d7b4ccd0e71bddbf303c5bc8f20fe2","observation_id":"6ab12f3d-4cd6-42aa-a93e-ee65128665ae","resolution":{"observed_at":"2026-08-10T21:56:43.934729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2661","last_updated":"2014-06-10T18:58:17Z","snapshot_observed_at":"2026-07-06T03:46:00.791740Z","submitted_at":"2014-06-10T18:58:17Z","title":"Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2661","snapshot_observed_at":"2026-08-10T21:56:43.943705Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.943705Z"},"links":{"cited_paper":"/paper/1406.2661","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:1d425b6e39ae5808dc9aa88357e980b065a1f8ae50590e97bd3b0d3a5e586640","observation_id":"3452543c-ef77-4cf6-9618-acf26b7df7a8","resolution":{"observed_at":"2026-08-10T21:56:43.943705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:43.950350Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.950350Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:8dc2fe9c8deae1484147b7994dac79d51dcbb3e290d0f927ef9998ad1b53c4d7","observation_id":"7ff762b9-2c0b-4789-bf74-b3383bc6f2a4","resolution":{"observed_at":"2026-08-10T21:56:43.950350Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-10T21:56:43.956292Z","title":"Emu: Enhancing image generation models using photogenic nee- dles in a haystack, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.956292Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:89d784c081c6393a4e9e1af1252664d5b6a26222ed2a2214435bbd74e2f984f2","observation_id":"7df01af4-5eaf-4840-bdfc-2976047d096d","resolution":{"observed_at":"2026-08-10T21:56:43.956292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.052716Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium, 2018","venue":null,"work_id":"f20aca10-10f2-465e-b143-ee1dd7939ede","year":2018},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.961715Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:ecf0f91a35dbb6d5580a21664fcd1c105bc43c8f90a51c050b597bbb54982b4d","observation_id":"1bfc2511-0e92-48c1-98ec-5f20dc11f165","resolution":{"observed_at":"2026-08-10T21:56:45.057932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07466","last_updated":"2023-10-30T11:52:16Z","snapshot_observed_at":"2026-07-06T10:14:38.654601Z","submitted_at":"2020-11-15T07:29:41Z","title":"Continuous Conditional Generative Adversarial Networks: Novel Empirical Losses and Label Input Mechanisms","version":9},"cited_work":{"arxiv_id":"2011.07466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.07466","snapshot_observed_at":"2026-08-10T21:56:44.270951Z","title":"Continuous Conditional Generative Adversarial Networks: Novel Empirical Losses and Label Input Mechanisms","venue":"cs.CV","work_id":"7ce80ff7-d808-45da-be8b-2b2e8ae4fe8c","year":2020},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.966283Z"},"links":{"cited_paper":"/paper/2011.07466","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:9ee04da7f3a0d7768d23800bc7fedc6683ca13c78187b59ed6404be0995a51d8","observation_id":"b4ebcfb0-4e36-4f45-bd47-3146680c8f44","resolution":{"observed_at":"2026-08-10T21:56:44.281547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03498","last_updated":"2016-06-10T22:53:35Z","snapshot_observed_at":"2026-07-06T04:59:35.089671Z","submitted_at":"2016-06-10T22:53:35Z","title":"Improved Techniques for Training GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03498","snapshot_observed_at":"2026-08-10T21:56:43.972119Z","title":"Improved techniques for training gans, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.972119Z"},"links":{"cited_paper":"/paper/1606.03498","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:98ae70ebae4443d39af6ba3f96492013368c30cadd038a3ee47ac457bf4a9f7c","observation_id":"cf57f155-8c9d-4c1d-9ba0-59f850a792c5","resolution":{"observed_at":"2026-08-10T21:56:43.972119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06991","last_updated":"2019-10-30T12:33:29Z","snapshot_observed_at":"2026-08-09T23:44:12.843579Z","submitted_at":"2019-04-15T12:20:32Z","title":"Improved Precision and Recall Metric for Assessing Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06991","snapshot_observed_at":"2026-08-10T21:56:43.977508Z","title":"Improved precision and recall met- 12 ric for assessing generative models, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.977508Z"},"links":{"cited_paper":"/paper/1904.06991","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:2dd6fc21c39dd7e8505f372bb3f9ad966825b00c6ed2be7bc591ac510f8d78eb","observation_id":"5ea93eba-8338-490f-8f0f-ae1a569fe50d","resolution":{"observed_at":"2026-08-10T21:56:43.977508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T21:56:43.983864Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.983864Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d5676a09474007be05f841de8f4095394253c11561505fdc75ad6558f1a6c962","observation_id":"f90a27c8-0694-462f-a513-6a4fb9e88efb","resolution":{"observed_at":"2026-08-10T21:56:43.983864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.033500Z","title":null,"venue":null,"work_id":"53445e38-34c8-4872-95a1-164385fd831c","year":2021},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.991519Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:b24fa6a2a5521b0fbdf605c63ff555b12906d632e685fa0c440c12a1b650ac98","observation_id":"0a478b81-018b-4d60-988a-a0871f770422","resolution":{"observed_at":"2026-08-10T21:56:45.040807Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15004","last_updated":"2024-12-05T02:00:07Z","snapshot_observed_at":"2026-08-05T16:22:08.749834Z","submitted_at":"2024-11-22T15:26:23Z","title":"ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15004","snapshot_observed_at":"2026-08-10T21:56:43.996371Z","title":"Scribeagent: Towards specialized web agents us- ing production-scale workflow data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.996371Z"},"links":{"cited_paper":"/paper/2411.15004","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:6c9be40584636d3c848cddfb702051650b8d4176c3182b2b7f60fb658330dc58","observation_id":"61a9a0bc-f40a-4fbb-93ee-32571eda1467","resolution":{"observed_at":"2026-08-10T21:56:43.996371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T21:56:44.001955Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.001955Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d02b94dd86828a308f0aa3bd26325dcbd5e68f6d9a7b0c7a61070e2075f8b27a","observation_id":"ff4b7560-59d4-46f4-ac89-223f0fa434c4","resolution":{"observed_at":"2026-08-10T21:56:44.001955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.014547Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model, 2024","venue":null,"work_id":"abae5dd5-63b9-4497-ac92-1e28d543bd45","year":2024},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.009461Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:ae9204290b6645ef5c9f4e0653381699268a9698e0b84ebfecec896ef19ac927","observation_id":"fc7e872b-1719-4442-be81-b223937911a2","resolution":{"observed_at":"2026-08-10T21:56:45.020162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.016173Z","title":"A style-based generator architecture for generative adversarial networks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.016173Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:bcddac420ad901ba2fdf28861eff8b97c3f66de100d5167c0da01e3723855543","observation_id":"92e4e978-0a98-4045-9b01-3f55450d391e","resolution":{"observed_at":"2026-08-10T21:56:44.016173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.983066Z","title":"The open images dataset v4: Uni- fied image classification, object detection, and visual rela- tionship detection at scale","venue":null,"work_id":"afce14bc-c762-4602-a471-568c6f16dd8e","year":1956},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.032020Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:18f07578188caec552592ecabd2868f680f3fae8d6a09b76fbe694b6832d99fb","observation_id":"4a80a1eb-af9b-4497-84f8-6bd852528ad6","resolution":{"observed_at":"2026-08-10T21:56:44.988101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.965335Z","title":"• Are there faces in the image? → Yes/No","venue":null,"work_id":"b2ffbc2c-850c-4ef7-bfa6-ee1a552b35dd","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.045089Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:6e192ebd440e57953f728de95c1e870822fec961909ece07374c79ea57d0969d","observation_id":"83334c58-8ad6-4df3-bfd6-32c28caee51c","resolution":{"observed_at":"2026-08-10T21:56:44.971378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.949434Z","title":null,"venue":null,"work_id":"ef8c2957-7af0-40c6-b1cd-24e0ae4e7598","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.050336Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:aeed709089bd3e051cd7b055dd65eb050cea8fed10b0efca3da3c16d039ae5de","observation_id":"e9454bba-2eb3-4726-9f8b-2228c1568863","resolution":{"observed_at":"2026-08-10T21:56:44.954309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.931271Z","title":null,"venue":null,"work_id":"d95d8340-a0b4-4800-a1cf-c8b934b7c569","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.055922Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:dd36000680d7d3d0ac29e539de503be06dd7368d7373f9829abcc7d374332329","observation_id":"e40a356b-b7c3-4ef5-b6ae-5f1655ce9c5d","resolution":{"observed_at":"2026-08-10T21:56:44.937162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.914020Z","title":null,"venue":null,"work_id":"0f7b7d44-08fb-4a83-badd-f9b8e6746c11","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.062696Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d8937a2aea6cdb1609f898c01bd07af665832c289e24c44397e500f29bb1d161","observation_id":"6dda0d0e-11d9-4d99-af8d-f7f860ec2c84","resolution":{"observed_at":"2026-08-10T21:56:44.919341Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.896956Z","title":"Score: ? out of 9","venue":null,"work_id":"43a5fb43-63d5-4881-b1ab-1f557d2a3de5","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.067455Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:e654e353d889b78f71428cca5847f40e026e53fddfdb374490b2c12ef9b970d7","observation_id":"d6a455bc-8753-4bdb-9051-672e72da3003","resolution":{"observed_at":"2026-08-10T21:56:44.902038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.879259Z","title":"Architecture We implement the nested V AE similar to theAutoencoderKL implementation of the diffusers library","venue":null,"work_id":"82899251-3d0a-493c-85fe-3a889e36bda5","year":2014},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.072620Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:ed451278f2cc83b80acd283e81710eb24de1c315f3c0f9123d45216c1e5ee1e2","observation_id":"d9e41782-d961-41d8-8544-6dc7eb932db8","resolution":{"observed_at":"2026-08-10T21:56:44.884556Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.861950Z","title":"Architecture We use DiT-XL architecture with a patchify downsampler and patch size of 2","venue":null,"work_id":"2b473c94-d9cf-42dd-9085-a5e8d6a155a1","year":2014},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.078464Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:d84cfd65c4b9f25db6723ad67cf346355ad74e9d920473c1c6779769ec67c817","observation_id":"026763e5-32e4-4baa-adeb-7a35b731b69f","resolution":{"observed_at":"2026-08-10T21:56:44.866856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:44.039620Z","title":"URL http: //dx.doi.org/10.1007/s11263-020-01316-z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":1405,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.039620Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:cbdc465146897eef165b2cb55b44b282b2fe3abe8e95bdb97263d5fdfa202924","observation_id":"bf636b65-d38d-49c4-88de-4245d4e1b651","resolution":{"observed_at":"2026-08-10T21:56:44.039620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-10T21:56:43.832491Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.832491Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:9d0cae957fd2c40ec0d5c397c37a7f4ddb38398a415a50f87bc0a926582ebdc5","observation_id":"3bfd9566-4c09-414d-b4c9-f0f8bd8c97b3","resolution":{"observed_at":"2026-08-10T21:56:43.832491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04948","last_updated":"2019-03-29T11:08:46Z","snapshot_observed_at":"2026-08-10T12:08:24.752628Z","submitted_at":"2018-12-12T13:59:43Z","title":"A Style-Based Generator Architecture for Generative Adversarial Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04948","snapshot_observed_at":"2026-08-10T21:56:44.026023Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:44.026023Z"},"links":{"cited_paper":"/paper/1812.04948","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:34a0668f676aa12a75c5dddcdfb63ef5463d63e71451715ec2c91e45f48a1afb","observation_id":"b044cd92-913d-436d-8396-5def3a5c8520","resolution":{"observed_at":"2026-08-10T21:56:44.026023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:45.117602Z","title":null,"venue":null,"work_id":"11da3048-cf3a-4a60-b6ea-68c4ed4989c1","year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.884352Z"},"links":{"citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:7cbeb358cb2b5c04a4841b4ba062b325c01f6d7cf76686f8ab73fa08fec1347c","observation_id":"a59f1b9c-d13f-4faa-b7ce-7acb0f72de92","resolution":{"observed_at":"2026-08-10T21:56:45.122987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T21:56:43.916875Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:43.916875Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.03120"},"observation_digest":"sha256:2c7961f96e611f32ef060b9313ee83c267f6f2afdaf38444a29a0902b4b29a26","observation_id":"3b6cb5fb-e623-40a4-859b-73f3eee76e44","resolution":{"observed_at":"2026-08-10T21:56:43.916875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03120","last_updated":"2025-01-06T16:28:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:50:50.344907Z","submitted_at":"2025-01-06T16:28:47Z","title":"CAT: Content-Adaptive Image Tokenization"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":38,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 10 inbound Pith citation observations for arXiv:2501.03120."}