{"as_of":"2026-08-20T03:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dc7bdabdf38069b13f2873785798375a47a1c207d51bed8cd5faca3f6f95fe4","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:05:22.416317Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:09:25.049534Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:06:44.335867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"cited_work":{"arxiv_id":"2506.03643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03643","snapshot_observed_at":"2026-07-02T07:06:44.335867Z","title":"Images are worth variable length of representations","venue":null,"work_id":"b412ac37-71f0-4023-9595-9e6dcb1eb853","year":2025},"citing_paper":{"arxiv_id":"2603.06351","last_updated":"2026-05-07T16:40:07Z","snapshot_observed_at":"2026-08-11T15:47:08.117539Z","submitted_at":"2026-03-06T14:59:11Z","title":"DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:10:00.146694Z"},"links":{"cited_paper":"/paper/2506.03643","citing_paper":"/paper/2603.06351"},"observation_digest":"sha256:912e88ef484bd8141dfadf47f0d7b69fcebc8c20d819bae007899adb8891fa55","observation_id":"acf9eb43-b6b6-45a5-8c17-8e97430f7680","resolution":{"observed_at":"2026-05-15T15:10:05.814629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"cited_work":{"arxiv_id":"2506.03643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03643","snapshot_observed_at":"2026-07-02T07:06:44.335867Z","title":"Images are worth variable length of representations","venue":null,"work_id":"b412ac37-71f0-4023-9595-9e6dcb1eb853","year":2025},"citing_paper":{"arxiv_id":"2606.04461","last_updated":"2026-06-03T05:10:51Z","snapshot_observed_at":"2026-08-15T16:27:36.136478Z","submitted_at":"2026-06-03T05:10:51Z","title":"ChannelTok: Efficient Flexible-Length Vision Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T07:09:25.049534Z"},"links":{"cited_paper":"/paper/2506.03643","citing_paper":"/paper/2606.04461"},"observation_digest":"sha256:5592736a16c0c43da03526b237b1f22071b62851fbf7a5e115690ad1be85f758","observation_id":"2b64c07e-428e-4fbb-9902-0b96192c6b33","resolution":{"observed_at":"2026-07-02T07:06:44.338154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03643/citation-record","integrity":"/paper/2506.03643/integrity","json":"/paper/2506.03643/citation-record.json","paper":"/paper/2506.03643"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:05:22.235943Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.235943Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:34f6c53e8bfe4fd21c4f751ffd41cc94993cb2298119c2a024d6f9c2e9ee61e6","observation_id":"5fa297b5-09a8-47db-b861-d400370d9dc8","resolution":{"observed_at":"2026-08-07T11:05:22.235943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.239610Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.239610Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:70e7ef44f19289ffd9d658a10e46f8cbad2c1e59c738696da4200a647fb415c7","observation_id":"45912b42-4cdf-44e2-9917-854b7273e822","resolution":{"observed_at":"2026-08-07T11:05:22.239610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.242682Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.242682Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0ea110ba6700d54ac76334529aef7717adabe939b1a6bce6776aa9b4efdfc6b6","observation_id":"d03f0524-d703-4c29-84d8-f74e3ed3d7c6","resolution":{"observed_at":"2026-08-07T11:05:22.242682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.931252Z","title":"Revisiting active perception.Autonomous Robots, 42:177–196, 2018","venue":null,"work_id":"a5be93d3-6744-409e-885d-bb6ac1c17116","year":2018},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.245814Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:47aafee4cb50556391388e4e51380a4f8b614107b13477f6a1b66a54890c5547","observation_id":"a2f8e363-b706-42b5-8f02-f5da44c53879","resolution":{"observed_at":"2026-08-07T11:05:22.934151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.921825Z","title":"Blur image detection using laplacian operator and open-cv","venue":null,"work_id":"a97f9ba0-9828-476b-ac53-f6d44a703d84","year":2016},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.248818Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:ee29f734d38caf33fefa36dcd3956a3278d1fd6121ff806d4a7cc9e17bd8eea9","observation_id":"fd3a7952-9f8a-4c5d-a704-96bcde14e1db","resolution":{"observed_at":"2026-08-07T11:05:22.924943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.910824Z","title":"Statistical inference for probabilistic functions of finite state markov chains.The annals of mathematical statistics, 37(6):1554–1563, 1966","venue":null,"work_id":"b0124ea0-faf3-4677-b398-a16d4db53ea8","year":1966},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.251721Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3efad992eda56667045cb29700f05d73962f6d5fc685d4f68d09806f46d7a10b","observation_id":"f132ad6e-5e22-4f43-a69a-77c5872919e6","resolution":{"observed_at":"2026-08-07T11:05:22.914977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.900404Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"31199b02-7f12-48da-bd1f-5da04c4ddc65","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.255187Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:56ea4d627d8ddbfa60efbeff57b8ede09146074bf4c43dd65a4f4a9f7bb8e071","observation_id":"891de3fe-d2f9-477f-8142-191130b5ae5e","resolution":{"observed_at":"2026-08-07T11:05:22.904132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.257886Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.257886Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2ca0fd6f7ce37314dc071270223e5734a494db94f88a96fb341133e8f761558e","observation_id":"01c49392-716c-4588-a8b7-6ca5ececbaaf","resolution":{"observed_at":"2026-08-07T11:05:22.257886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.260665Z","title":"Food-101 – mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.260665Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:5a9420f575e06df1332a8e88d36fb467d9277690cad81af04c64412bfbee2710","observation_id":"ad4bbdee-535d-4a74-9173-da359f52b388","resolution":{"observed_at":"2026-08-07T11:05:22.260665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.263449Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.263449Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:9807ebd2fe0854409b0d487e07c5da64956c1bb2e7902332e76b8e07bfff2a43","observation_id":"2172ddcb-58ec-4afc-ac8b-c87d2e38167b","resolution":{"observed_at":"2026-08-07T11:05:22.263449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.869988Z","title":"Efficient large multi-modal models via visual context compression","venue":null,"work_id":"e3ac39dd-ae53-4a2e-815f-c639760050d1","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.266244Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:dedf0ce9fa67aed592ba2f17901ec669dcde8dbd0c9e7dd15142c09ef176d088","observation_id":"e44a12e4-71b8-4b62-b426-1cd75b084c70","resolution":{"observed_at":"2026-08-07T11:05:22.873209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.859781Z","title":"Review of image classification algorithms based on convolutional neural networks.Remote Sensing, 13(22):4712, 2021","venue":null,"work_id":"dc8a8528-98b1-470a-aeba-9f01b50249a2","year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.269137Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:5eb999019129dbd07089ca77c8cf76e15955aa74406b1db133623b367e91b3cb","observation_id":"01fa2fea-701b-42d8-a567-8bd7311bcea3","resolution":{"observed_at":"2026-08-07T11:05:22.862922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.849565Z","title":"An empirical study of smoothing techniques for language modeling","venue":null,"work_id":"9a688861-4f0b-4aea-aec5-bf82c12c18fb","year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.271750Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3d012305af1f6bab4de938b4fda197a2748b7917be92d059b428e019846d154b","observation_id":"ca84c8ff-6e6b-486e-b2f8-78b8f3a4b496","resolution":{"observed_at":"2026-08-07T11:05:22.852630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.274496Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.274496Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:41196115a263d583e7a7acb6c680e1f33ec5ec0600ec4b035eadeb3743455c20","observation_id":"8d482209-8cb5-4eab-a1d2-0e307aee191e","resolution":{"observed_at":"2026-08-07T11:05:22.274496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.833777Z","title":"An analysis of single layer networks in unsupervised feature learning aistats","venue":null,"work_id":"d594c131-afec-40b4-bf3c-be7eca1c0c93","year":2011},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.277525Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:92ca9c85040f7835e909f7f0a705db9c72c91dafbfd5d68959ec62acfc81a37f","observation_id":"6e7ac09b-2df3-4c41-b5d0-2c3d7ccca8a1","resolution":{"observed_at":"2026-08-07T11:05:22.836894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.280475Z","title":"Scaling up dataset distillation to imagenet-1k with constant memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.280475Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:86852c11592138eb7e2472150f6970403df26ccfaef6f070163e36c2c0dcc82b","observation_id":"c9be1d94-02f7-47eb-b6b9-6470a20c06c5","resolution":{"observed_at":"2026-08-07T11:05:22.280475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.816141Z","title":"Top-down control of eye movements: Yarbus revisited.Visual Cognition, 17(6-7):790–811, 2009","venue":null,"work_id":"95cee089-ead6-40b4-83ec-b3c3e05fc300","year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.283436Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d499e7045b46b4fe501eb868677d02b846db650d57b5630c48770680892ebb80","observation_id":"9e6443a4-945f-40b8-b154-11e647a0239c","resolution":{"observed_at":"2026-08-07T11:05:22.820288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.805875Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"6001f945-9318-4da9-a2f8-809bb82891f0","year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.286379Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:e761bd990e9a5443ac0f7bcc89a32012afea323ef5d21817c3404ffdea553411","observation_id":"c76268b8-cb52-4d1e-a89b-0b55abb2c568","resolution":{"observed_at":"2026-08-07T11:05:22.809368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.289289Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.289289Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:72f7008e9ca5496afb79255129cbb45ec106c8e0a1a743c4ccae00567fffa202","observation_id":"ff348b87-899f-4bd0-9660-cbc8c5a06b90","resolution":{"observed_at":"2026-08-07T11:05:22.289289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.788660Z","title":"Adaptive length image tok- enization via recurrent allocation","venue":null,"work_id":"fbeddfb7-b0ea-4c7c-b523-05ddc65cfde4","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.292319Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d6a821eb3c7990ca1aeb46d2411e1992db0e2c5876e54856a2043beff23f68d4","observation_id":"92471137-7e22-4321-8b0b-a8cba96c9d0f","resolution":{"observed_at":"2026-08-07T11:05:22.791905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.295367Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.295367Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:11bbc691e79812028766d005481f4a2efea833bdc1f3e284dbac41a9df8e8682","observation_id":"6b25f19e-82c0-4e3e-90c4-99087b80d5c5","resolution":{"observed_at":"2026-08-07T11:05:22.295367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.772395Z","title":"Multimodal autoregressive pre-training of large vision encoders, 2024","venue":null,"work_id":"91f8834d-0869-432d-8aa5-3a89710f252d","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.298398Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:18f6bd6bb52b636be0e6f7854227ac9a98299f9b7f2224718c90d0e551354852","observation_id":"95c113f2-cfef-4850-8774-b2cb5ebb92f9","resolution":{"observed_at":"2026-08-07T11:05:22.775879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.301186Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.301186Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:db752f7543da5e17c3fcac5847c9847e6b722aa518c36584bbe989be15916594","observation_id":"d7e007a9-dfd4-4daf-8305-60905aef446f","resolution":{"observed_at":"2026-08-07T11:05:22.301186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:05:22.304085Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.304085Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:19d2f1623801dda50cf0ff7d1602c4f2111a01dc4e0ed627371fbd9f8f6088b1","observation_id":"c6bd0c5f-092f-44b4-b79f-b4dcf9d75158","resolution":{"observed_at":"2026-08-07T11:05:22.304085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:05:22.307061Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.307061Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2e6c2c78742ae382a57fb97fe518dafd6edfad74899c160f77eafb887a7bf7e6","observation_id":"fe918958-fb65-46b5-ba89-513bb74ace0d","resolution":{"observed_at":"2026-08-07T11:05:22.307061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.755273Z","title":"A review of semantic segmentation using deep neural networks.International journal of multimedia information retrieval, 7:87–93, 2018","venue":null,"work_id":"1d203107-4cb4-4a5d-9605-0e5f2daedad3","year":2018},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.310089Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:087c5614176ca6a1a6c16b543c8e0b64a307746a1eef25e9100f63f84ff1c178","observation_id":"43299d14-b086-4b06-b686-53aa23a0cc53","resolution":{"observed_at":"2026-08-07T11:05:22.758858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.312920Z","title":"A brief survey on semantic segmentation with deep learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.312920Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:44cb97ebe9677b7b931ae2bc4113364a42b62a7cb336618d7bd705853467ab41","observation_id":"019de7a3-6c95-41e8-9e30-3ea473633ec8","resolution":{"observed_at":"2026-08-07T11:05:22.312920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.738127Z","title":"Hierarchical cross-modal agent for robotics vision-and-language navigation","venue":null,"work_id":"1eae6284-1f51-467a-8dad-7bec8fddae85","year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.316327Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:419c6c8147a520e0e45d4f304618e05cda32a7141256e2e5ca64941ec9e1951a","observation_id":"48f972e5-dcc0-4816-9149-9f89f62bbbe1","resolution":{"observed_at":"2026-08-07T11:05:22.741335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-07T11:05:22.319209Z","title":"Perceiver io: A general architecture for structured inputs & outputs.arXiv preprint arXiv:2107.14795, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.319209Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:e8401bbba50a262807de4569c36dfa9aa8bfe16506dacc8e4c8f3298061332b3","observation_id":"6bece6e8-d26d-4f67-b9c6-82763fa8dad1","resolution":{"observed_at":"2026-08-07T11:05:22.319209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.322257Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.322257Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:f58dd8e72cb8919724b2b02df65caaf632e405bb609938f81ed273864dc63778","observation_id":"f3001747-ebb7-4a85-b3d1-db8d77ccf7f0","resolution":{"observed_at":"2026-08-07T11:05:22.322257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.324996Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.324996Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:34570891b8adf545aac18875e7bc69fbac0815e7f3201931279771169892ae34","observation_id":"9b001137-dc8a-4ab0-a6e0-3bccaf5394aa","resolution":{"observed_at":"2026-08-07T11:05:22.324996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.327905Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.327905Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7f6ca99cff50134c04748db6fbe497920f9d777a0f25a3116bd0ab2d92360abe","observation_id":"36a19078-aea1-4d25-ba63-b83344cfb3e3","resolution":{"observed_at":"2026-08-07T11:05:22.327905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.330945Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.330945Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:81720a2d91ed48830379bdde56ccb24812888bdcc3ddbf65b4bd11be8181cbc3","observation_id":"41ee6020-27b0-4d1c-8767-75c13e86566b","resolution":{"observed_at":"2026-08-07T11:05:22.330945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.334047Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.334047Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:166d1566e1a8672299ca4541f016d2ef40481d53a9c76796b8e0423f7b978720","observation_id":"77620b32-7059-4b66-a838-71e014c302c0","resolution":{"observed_at":"2026-08-07T11:05:22.334047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.694378Z","title":"The roles of vision and eye movements in the control of activities of daily living.Perception, 28(11):1311–1328, 1999","venue":null,"work_id":"c582696c-8d83-431d-bcb0-5dec1b90846d","year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.336862Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:9168ffa684ccbf6f217f536c957e0bc2ad172c266255d029d662008f16a405ef","observation_id":"d9380372-0304-4957-9e22-d96bf19a583d","resolution":{"observed_at":"2026-08-07T11:05:22.698087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.340117Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.340117Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:e9b2e50cac023d949949ae89ef3bdcd6116ebc796635032d193c065e68831a2e","observation_id":"42c60635-8e1e-4e20-972e-3a8ba85d4ffe","resolution":{"observed_at":"2026-08-07T11:05:22.340117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.677973Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"219e891a-33b6-472f-b51f-ab304d6fbdf3","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.342828Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:01d2e8cb09f63d7eef31654b136702657e5af3f384c065e945d598e476509eef","observation_id":"f52a53eb-89ab-4977-b03b-1fc26cb8d4c5","resolution":{"observed_at":"2026-08-07T11:05:22.681102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.667308Z","title":"A survey of image classification methods and techniques for improving classification performance.International journal of Remote sensing, 28(5):823–870, 2007","venue":null,"work_id":"b8fef232-ad16-4822-99e8-e336c52e8a80","year":2007},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.345651Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:a0638746208e68896761a84883c24b758a0492b0972420441eaaa2b6cf8fb7d7","observation_id":"96561ff4-5ad4-48de-8efe-babd7df27e49","resolution":{"observed_at":"2026-08-07T11:05:22.670826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.348474Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.348474Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:cb8bc895b4cc6439ea10501a932946befc893140b19c80844889fdc54688503b","observation_id":"4e3f4811-8715-4b05-a7b0-9bbde605c2c1","resolution":{"observed_at":"2026-08-07T11:05:22.348474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.351532Z","title":"Fine-grained visual classification of aircraft, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.351532Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:236db2256f80c7fefbd42f0da3c792442c1035532b7ce41d03486c5938a835e9","observation_id":"5692391d-aa2f-4c6c-a73f-199b11dd5a1a","resolution":{"observed_at":"2026-08-07T11:05:22.351532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.354914Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.354914Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:02a5afc82d21a7d4d91295291afc363fa523cc4c97dd35d04d1a8958255d26d3","observation_id":"00df95de-f42a-4d2f-9812-6f9301f61c5f","resolution":{"observed_at":"2026-08-07T11:05:22.354914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.357727Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.357727Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:80acd1a847c35f882cbeec566a374af3bb4fd4a2daa4f918ac7e59c08b3c108a","observation_id":"7da9feef-d2de-41b9-a215-da20f4d4b611","resolution":{"observed_at":"2026-08-07T11:05:22.357727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.360520Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.360520Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:437663ad5532b3696a05f5297dbbaa50eaacbbd28bda48d716b3760fa15ee67c","observation_id":"7b8df15e-85fb-43e6-bb6a-f7c9738b71e3","resolution":{"observed_at":"2026-08-07T11:05:22.360520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.363555Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.363555Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:05761965e3d886b981f074c81b8ab88ba2076bf167200674659aea455f695762","observation_id":"d92654c2-b6b8-4e24-9f1a-081cd8ab8de1","resolution":{"observed_at":"2026-08-07T11:05:22.363555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.616256Z","title":"Stl-10, nov 2024","venue":null,"work_id":"1bc87bc2-f8f7-4f25-ac32-0fd11441ac30","year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.366118Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:15560e77fd44fe500045c3f40feb4a3c32483a382b0ddcb317e22099e72219c7","observation_id":"aaeaaffa-f164-4f98-8d82-5f7d2d7c1063","resolution":{"observed_at":"2026-08-07T11:05:22.619520Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.368954Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.368954Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:77e588b9359879e3553f86a30e91c2e09d9fa4c35e3fab565a56599b8fcac516","observation_id":"2ae2af82-135c-4123-8a5c-2f48793d3f72","resolution":{"observed_at":"2026-08-07T11:05:22.368954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T11:05:22.371771Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.371771Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:a5ca7fe90c773e3eb8e755dccd32881a95053f06e10dfe7817295cb9d5fef866","observation_id":"82b92334-15b0-45d2-94c7-f836d7634716","resolution":{"observed_at":"2026-08-07T11:05:22.371771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.374870Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.Advances in neural information processing systems, 34:13937–13949, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.374870Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:b85baa75e20758e342e3ecf6229df632ff6f5d4bc15c38e1b97c731b9e22905b","observation_id":"10ca220c-212c-444f-8b32-e6b1ef1576ec","resolution":{"observed_at":"2026-08-07T11:05:22.374870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.377480Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.377480Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:55537b23a8c213b3c8723e3fba45166a7b7e3bcedc3a0431e4c9ce576e293dc8","observation_id":"3be09f3f-052c-41df-aa96-d8b96c5b0430","resolution":{"observed_at":"2026-08-07T11:05:22.377480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.381721Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.381721Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:2316b24d5b0c37499fd1fa9a20fea0c54a1eb49bcc5e19d35bf7c5b80c1ae3b5","observation_id":"88a6ba60-4198-4c95-bf35-0f7e44931193","resolution":{"observed_at":"2026-08-07T11:05:22.381721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.384499Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.384499Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:bd82f307c3598c6db8002d22623fb072e1bd7a52f1a1f5b47709ef810c879b1a","observation_id":"fe8720a3-f6eb-49ed-81c7-91b2fcbd33f4","resolution":{"observed_at":"2026-08-07T11:05:22.384499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.387502Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning.Artificial intelligence, 112(1-2):181–211, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.387502Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:c9a029c19856c0f502ea24fd3f061b1cfe72bd71cfad1d73a2840525394aa50b","observation_id":"05203ea4-08d8-4c28-9b26-bfc328771026","resolution":{"observed_at":"2026-08-07T11:05:22.387502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:05:22.390224Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.390224Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:38fb1dbea1f77c37122af919adb785d606155d3e7376d276d673a120bb8b7123","observation_id":"8866789d-7efd-46b3-91d9-5bbeb1ed0fcb","resolution":{"observed_at":"2026-08-07T11:05:22.390224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.393356Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.393356Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:3117cd2e259626c91c638c3dd1561168eb7e31ecc4419d287ac688845459ffb8","observation_id":"6e42155a-daaf-4746-9f3f-11801312b986","resolution":{"observed_at":"2026-08-07T11:05:22.393356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.396119Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.396119Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:0e0189e9a683bb59942774c5219da5fcc7d6aae2be8aa8127f394a383b305846","observation_id":"d13295d0-1535-4bae-b745-3635609c0cdd","resolution":{"observed_at":"2026-08-07T11:05:22.396119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.555004Z","title":"Supervised hashing for image retrieval via image representation learning","venue":null,"work_id":"304fed39-cb41-45ce-a511-2a31a17f4a18","year":2014},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.398997Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:a846f295396b07711dd5fea05c96e96d5af4a9ddbf3f16cce1bfe7cbac1f4b08","observation_id":"c6c02abb-3fb2-480d-8926-60765e2584e4","resolution":{"observed_at":"2026-08-07T11:05:22.558474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.545307Z","title":"Ehinger, Aude Oliva, and Antonio Torralba","venue":null,"work_id":"222d9e69-c4e5-4b27-a8f6-b54a0a229ceb","year":2010},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.401621Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:d45424fbba30653a5e3cf994b3a6e80ab32c3ad4e9f2f0fe87c048687955bfc0","observation_id":"584a92dd-b964-41ec-8b3b-20017a04943d","resolution":{"observed_at":"2026-08-07T11:05:22.548329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.404732Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.404732Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:7951c7f6645ff886d5da1d7f5434fa76c0bc8c4136acd4606e1eabaf54600048","observation_id":"bc20ad02-831e-4c8b-b824-d8e030d24534","resolution":{"observed_at":"2026-08-07T11:05:22.404732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-18T22:18:02.034966Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T11:05:22.407403Z","title":"Scaling autoregressive models for content-rich text-to-image generation.arXiv preprint arXiv:2206.10789, 2(3):5, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.407403Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:669c27878ccde129b30a42acab38824d186745949b6fa2233a39a7a50aeb22b0","observation_id":"b7f27687-3010-43f3-bdbe-4f0cc2ef0e23","resolution":{"observed_at":"2026-08-07T11:05:22.407403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.410713Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.410713Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:25009ad53f011b431d02f8899943d2d41c9066a51b4f7491fd2e3fdf4ae1a3e8","observation_id":"2f1ff9be-878a-4111-aedb-0634abbdcec8","resolution":{"observed_at":"2026-08-07T11:05:22.410713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.521901Z","title":"Object detection with deep learning: A review.IEEE transactions on neural networks and learning systems, 30(11):3212–3232, 2019","venue":null,"work_id":"cadacca5-9aa5-4a24-8bf0-1fe08b49cc70","year":2019},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.413512Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:17b6fe95f9bd4d07b0fd176d5e9c24d06775b185da9e0a02658a3c47cfc225e0","observation_id":"88729760-bbb3-4dce-b971-1b0cccb86c0b","resolution":{"observed_at":"2026-08-07T11:05:22.525814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.511107Z","title":"STOP” on a sign as “SHOP","venue":null,"work_id":"1628a2a2-ff05-4cd5-a09c-c8b2f8007739","year":2023},"citing_paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.416317Z"},"links":{"citing_paper":"/paper/2506.03643"},"observation_digest":"sha256:dce27061812b10e283ae58c5d5f49ab636356e71144d7fdef2b2b6f5f3d8ea95","observation_id":"73c305e8-6a6d-4ba0-b741-f6e23dfe44ca","resolution":{"observed_at":"2026-08-07T11:05:22.514936Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03643","last_updated":"2025-06-05T10:20:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T16:37:15.249117Z","submitted_at":"2025-06-04T07:40:33Z","title":"Images are Worth Variable Length of Representations"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":40,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2506.03643."}