{"as_of":"2026-08-07T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3961af77f95fd0b7fd53ce96e68e122923525fe0b2181ded2899a2055c0835e9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:00.168507Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":27,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":214,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:9791a9000884b94cc40708daf1e045a5a649aec375b03f6d083550cabea01667","observation_id":"739d5dad-b6b6-47d5-99ac-9a6729b8ee4d","resolution":{"observed_at":"2026-05-13T20:06:44.615691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:003ea5eaea833c0e13ba0630d9906fb65cbf06171439c6fec3d96017621ecee4","observation_id":"2e63b695-acb3-402b-8270-6b1634298980","resolution":{"observed_at":"2026-05-15T22:48:36.344214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T10:03:27.919346Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2405.09818"},"observation_digest":"sha256:93262908c10261a08553ba0d5bd184c67cc73af365eaf58898397dbe6f21c5a8","observation_id":"a157ff30-ed01-4622-8d76-af1ffb73c384","resolution":{"observed_at":"2026-05-11T10:03:28.152026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:2abf9758a39ab13735fb3eccd0005be969a738b56e02b2f187ba7a3fc7f44190","observation_id":"d85a6cb4-c31f-454c-a2d5-09905940a6cd","resolution":{"observed_at":"2026-05-11T13:10:20.609481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:26.887069Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2408.11039"},"observation_digest":"sha256:64c1c373c32f19b3f8ab01ad334fe43ff22edbc4a321abcf9fcbdbf7ba261dbc","observation_id":"3cdb2fec-7473-4b18-a944-37d7bf23c709","resolution":{"observed_at":"2026-05-13T05:57:26.997276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T00:26:21.313005Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2409.04429"},"observation_digest":"sha256:f525328c82438fba729788e85fc7057101474f4ab6cceaf89038354c962ec311","observation_id":"50606391-af01-487d-a526-855b56149c58","resolution":{"observed_at":"2026-05-16T00:26:21.382770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:5d549b8da1bb4d17c13ba335f5e7628bf87e3aa17ea09227b1cf834a9b6b30f2","observation_id":"7554d3b9-a55c-47e6-babf-3ee709a2ed4a","resolution":{"observed_at":"2026-05-11T10:56:09.455699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:5a776d40c317a2e74dab0c2b60ee59f56700d2569b70a424b4b5d43645f65dff","observation_id":"5d99ca5f-b621-4cb0-8da2-388754be6df9","resolution":{"observed_at":"2026-05-18T02:48:45.089761Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T23:51:43.934329Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2503.14324"},"observation_digest":"sha256:49edae1377d57698535098edda4f941b585220fef4ffaf032d570186bc73a7ac","observation_id":"a911f41a-9533-4efb-ade8-38a6107d7050","resolution":{"observed_at":"2026-05-22T23:52:16.729035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:e22445851477e08eea4f70f400d4aca86e6f338dfd56c7adcb9efc25668029f0","observation_id":"1f6f407e-d188-444d-b36f-0b6e4a9b9b6d","resolution":{"observed_at":"2026-05-17T07:24:04.730499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:50:00.168507Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.168507Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:497f2c9c822b73b06db75886b0e8b748e6450ff31431ea34e80f3fabbb457ea5","observation_id":"0349970a-a02d-4bfb-b826-ce4611bc89f9","resolution":{"observed_at":"2026-08-07T05:50:00.168507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:27:16.282820Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-07T05:18:41.616873Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.282820Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:05fd8512a0154f5cfc7face2af46e343bac9e16107ce3b6e5669840ea452ed30","observation_id":"cddd270a-1f4d-403d-a095-4b938064210e","resolution":{"observed_at":"2026-08-07T05:27:16.282820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T04:34:11.061508Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-07T04:25:14.940851Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:11.061508Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:d84471d59955a41562bc4cfa4217e3f1e1ad8c7995927cebe6829435d96ce495","observation_id":"e9b4edd9-af5c-4184-8228-db135bf16a19","resolution":{"observed_at":"2026-08-07T04:34:11.061508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-06T21:46:30.191271Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-07T20:34:54.751246Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:30.191271Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:8d69842f4cf49224224d57b71f2b6302ebec7f9b8f65323514de4f53c7c3855b","observation_id":"3e051434-6923-46ac-b071-f1409063ba81","resolution":{"observed_at":"2026-08-06T21:46:30.191271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2601.01593","last_updated":"2026-05-18T03:12:58Z","snapshot_observed_at":"2026-07-06T22:40:41.626783Z","submitted_at":"2026-01-04T16:46:13Z","title":"Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:09.843691Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.01593"},"observation_digest":"sha256:0fb05a991a81bb9da9cb7447fd93555679fbf37180b525d96a67096be1b48cb8","observation_id":"a3d45e71-80cd-47f3-bbb0-101445996b39","resolution":{"observed_at":"2026-05-21T17:00:24.100992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2601.14671","last_updated":"2026-04-13T06:15:42Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T05:33:23Z","title":"Mirai: Autoregressive Visual Generation Needs Foresight","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:16:16.461488Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.14671"},"observation_digest":"sha256:aa44e638f3f51c0d1039c53d9c438f0fa3d6cf9282095c8998084e3b2ee474d7","observation_id":"c1c71beb-6d0d-4eec-b642-46710fa28895","resolution":{"observed_at":"2026-05-16T12:17:52.072386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-03T07:13:01.740855Z","title":"naacl-demo.37/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21081","last_updated":"2026-06-17T18:55:04Z","snapshot_observed_at":"2026-08-03T07:13:00.392581Z","submitted_at":"2026-01-28T22:07:17Z","title":"Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T07:13:01.740855Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2601.21081"},"observation_digest":"sha256:bc9f664450308b121bf302265e507c8b1091b590929757c4737dcdb663875917","observation_id":"a8c6eaa1-d52b-47f3-9230-edd866b78180","resolution":{"observed_at":"2026-08-03T07:13:01.740855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2605.19227","last_updated":"2026-05-19T00:55:18Z","snapshot_observed_at":"2026-07-31T18:48:53.380189Z","submitted_at":"2026-05-19T00:55:18Z","title":"Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:46.236860Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2605.19227"},"observation_digest":"sha256:ad085b3c8855150c09622f572f6d672a88d2fc6a84d8cacee3e5cc8f2cffb916","observation_id":"6c18d0c1-30cf-445e-9666-814e7aa69a2a","resolution":{"observed_at":"2026-05-20T05:38:05.450573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2605.20316","last_updated":"2026-05-19T17:59:39Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T17:59:39Z","title":"FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T07:40:36.206754Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2605.20316"},"observation_digest":"sha256:2110cb4b3c1c66634aee708830ff7db82d9fd9d550cb4e037862a4b7d70adffd","observation_id":"eb19b34b-f87e-48c9-9918-9b17883db5ca","resolution":{"observed_at":"2026-05-21T07:44:03.082166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:4a353ef89635f456ae472962eb5bd0ecd00489ee4bb2a5a9f57e2dc0a206804a","observation_id":"7533d770-7924-41f1-a666-d1af27ffe8ff","resolution":{"observed_at":"2026-07-03T10:48:03.002018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:123f64de8ab1dff42b485b9798370b284bafe8ecc9ef788f1bd9a9bf3890cefa","observation_id":"c5eac19c-a2da-47f4-9386-824529c178d0","resolution":{"observed_at":"2026-07-04T10:09:44.661419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:0ffe8281d7f82e1f1be0ea952163d12c6d89cc73b7c902724193b986f36f4514","observation_id":"b62c772c-45f8-4b51-b1fc-f3b5fa752002","resolution":{"observed_at":"2026-07-03T23:19:02.540114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":"arXiv (Cornell University)","work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2606.28643","last_updated":"2026-06-26T22:56:54Z","snapshot_observed_at":"2026-07-07T00:02:43.396508Z","submitted_at":"2026-06-26T22:56:54Z","title":"Obliviate: Erasing Concepts from Autoregressive Image Generation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T00:28:37.837090Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2606.28643"},"observation_digest":"sha256:ce7a10489f2ce795612252f048756046e631ccfd85bee9fe54393b3cd5ce3b72","observation_id":"80d14c5e-5aca-41bd-bf26-dc472960ebc6","resolution":{"observed_at":"2026-07-01T16:35:50.633519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-07-14T15:55:25.318583Z","title":"arXiv preprint arXiv:2309.02591 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09776","last_updated":"2026-07-15T15:49:55Z","snapshot_observed_at":"2026-08-02T10:22:56.853033Z","submitted_at":"2026-07-08T03:03:38Z","title":"HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T15:55:25.318583Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.09776"},"observation_digest":"sha256:5bad3d3d3a405b621026bf89c566008dc3640568644440cdfe03337e8b75d387","observation_id":"a6b91e9c-04c0-486f-8eba-a1f81998cbda","resolution":{"observed_at":"2026-07-14T15:55:25.318583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-02T08:13:03.762013Z","title":"arXiv preprint arXiv:2309.02591 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09776","last_updated":"2026-07-15T15:49:55Z","snapshot_observed_at":"2026-08-02T10:22:56.853033Z","submitted_at":"2026-07-08T03:03:38Z","title":"HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T08:13:03.762013Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.09776"},"observation_digest":"sha256:138318e4a43647b28f66de20f6d4617376eb62c523f382b62cfc2dfde9605b8d","observation_id":"6a7d5a16-0de4-403a-bb72-3732166dc2cb","resolution":{"observed_at":"2026-08-02T08:13:03.762013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-01T01:51:50.147250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25642","last_updated":"2026-07-28T12:27:59Z","snapshot_observed_at":"2026-08-07T04:23:03.102990Z","submitted_at":"2026-07-28T12:27:59Z","title":"Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:51:50.147250Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2607.25642"},"observation_digest":"sha256:41c9653d9fd245d0793e529cc89e7e66e980de6dbfb8ca686f46598b2fa0fbdf","observation_id":"18ce830d-80e2-4c80-87b4-e5957605ca13","resolution":{"observed_at":"2026-08-01T01:51:50.147250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.02591/citation-record","integrity":"/paper/2309.02591/integrity","json":"/paper/2309.02591/citation-record.json","paper":"/paper/2309.02591"},"outbound":[],"paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2309.02591."}