{"as_of":"2026-08-12T05:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47fb692f259bf7a143297e7bb203c67cb82cf4b0efd0b74a5e73d07770f3e079","coverage":[{"denominator":292,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:59:01.581000Z","state":"measured"},{"denominator":117,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":117,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:42:31.574249Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:39:16.234771Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-11T11:42:31.574249Z","title":"Next token prediction towards multi- modal intelligence: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15119","last_updated":"2025-04-03T02:34:24Z","snapshot_observed_at":"2026-08-11T15:19:38.404584Z","submitted_at":"2024-12-19T17:59:54Z","title":"Parallelized Autoregressive Visual Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:42:31.574249Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2412.15119"},"observation_digest":"sha256:db4b0a6d414eae431da1ee4ae726c4e18e8910274e9a9920726044e85b54767f","observation_id":"c3c21c6f-1c09-4d2c-b84d-216470d0d4f6","resolution":{"observed_at":"2026-08-11T11:42:31.574249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-09T21:47:59.515837Z","title":"Next token predic- tion towards multimodal intelligence: A comprehensive survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18993","last_updated":"2025-01-31T09:53:47Z","snapshot_observed_at":"2026-08-11T15:19:34.535546Z","submitted_at":"2025-01-31T09:53:47Z","title":"Visual Autoregressive Modeling for Image Super-Resolution","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T21:47:59.515837Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2501.18993"},"observation_digest":"sha256:3426855bb67a6a6769506bbd984f30b5cb3e3fbd1094d96dd0860dfc10c08e1b","observation_id":"f71d18ae-288c-4b3e-b5ec-688d1f8a70a4","resolution":{"observed_at":"2026-08-09T21:47:59.515837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-08T11:51:13.184615Z","title":"findings-acl.64","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07737","last_updated":"2025-02-12T14:50:50Z","snapshot_observed_at":"2026-08-09T14:39:05.131807Z","submitted_at":"2025-02-11T17:57:53Z","title":"Next Block Prediction: Video Generation via Semi-Autoregressive Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:13.184615Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2502.07737"},"observation_digest":"sha256:6869488cd2d6a1937a754708c8629f1e641e689163ff1249ef6880ef14d92157","observation_id":"22a69b2b-05a7-40c0-8e36-ad046e9930c2","resolution":{"observed_at":"2026-08-08T11:51:13.184615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:e4cd1f7134a629ec0f9c734e71bf5b5e8609f6c7ad75804a28ca1b976dab56eb","observation_id":"585b2bba-ca37-4592-acf3-41a4270dc873","resolution":{"observed_at":"2026-05-15T16:24:27.465541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:c6ea227cdd24b42d1512245ee0f8bde1346f763701b74941939d3f5b2eeebc04","observation_id":"2688273f-f0cc-40ae-ba27-e79b85be1831","resolution":{"observed_at":"2026-05-22T20:45:08.044990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-07T15:38:27.366464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14471","last_updated":"2025-05-28T11:00:28Z","snapshot_observed_at":"2026-08-10T02:36:13.772584Z","submitted_at":"2025-05-20T15:05:27Z","title":"Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:27.366464Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2505.14471"},"observation_digest":"sha256:e737b21ed84f21296e3cdab1df82b5229a412c3c7793417a9b0875994c36c16f","observation_id":"63f2893d-8961-4a1b-8a61-e8cfd3cbb1e0","resolution":{"observed_at":"2026-08-07T15:38:27.366464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-07T14:27:58.571076Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-08-11T21:13:30.197340Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:58.571076Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2505.21547"},"observation_digest":"sha256:40b760b172afa9dd4045b8bbd0f829bf9e8f4046fe1e3c708e0d76f50c31021d","observation_id":"ca3c074a-5b51-4347-af22-492564f5c003","resolution":{"observed_at":"2026-08-07T14:27:58.571076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-06T23:10:44.228630Z","title":"Next token prediction towards multi- modal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19217","last_updated":"2025-06-24T00:51:03Z","snapshot_observed_at":"2026-08-09T19:22:27.267511Z","submitted_at":"2025-06-24T00:51:03Z","title":"MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:10:44.228630Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2506.19217"},"observation_digest":"sha256:e16c1aec8bf78ae3574fa3362a507c7d1e6f4ebea13a28f183b869215cea92dc","observation_id":"18e7c4a7-cc8a-4549-9bf3-db27cfb420f7","resolution":{"observed_at":"2026-08-06T23:10:44.228630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-06T21:55:45.970164Z","title":"Next token prediction towards multi- modal intelligence: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23102","last_updated":"2026-07-06T06:04:13Z","snapshot_observed_at":"2026-08-08T21:05:19.837782Z","submitted_at":"2025-06-29T06:08:55Z","title":"Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:45.970164Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2506.23102"},"observation_digest":"sha256:1fd7f10979cf2f56743b0b40a0b83cc3cda83423b5c0308b3f3b2c9e89b119be","observation_id":"33a4a4e7-6b4a-4391-8c41-85d13f924c68","resolution":{"observed_at":"2026-08-06T21:55:45.970164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-08-05T13:00:48.147977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01071","last_updated":"2025-09-01T02:24:34Z","snapshot_observed_at":"2026-08-09T09:41:53.110870Z","submitted_at":"2025-09-01T02:24:34Z","title":"A Unified Low-level Foundation Model for Enhancing Pathology Image Quality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:00:48.147977Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2509.01071"},"observation_digest":"sha256:bae0322243a014590e104fa266ef1e4bff010410791379d1017134e3503a73ed","observation_id":"8eabab2d-0baa-405b-8d9a-8a88ffcd9422","resolution":{"observed_at":"2026-08-05T13:00:48.147977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2605.08809","last_updated":"2026-05-09T08:59:13Z","snapshot_observed_at":"2026-08-11T16:15:40.838250Z","submitted_at":"2026-05-09T08:59:13Z","title":"SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:45.192139Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.08809"},"observation_digest":"sha256:550d501b2bfa31de78947dd70aaf17cdbbd4ebda8766e5fce5e0fb432e6e3691","observation_id":"b0e0be72-5092-499a-9868-616165665746","resolution":{"observed_at":"2026-05-12T07:16:28.852066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T12:23:42.587689Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:d77a0119ab0cffcaed3d8c7155a96dd7459752a957850b656e6fe06ab92546d9","observation_id":"9e0d91d4-6eb3-4809-be35-12fa1b4a0948","resolution":{"observed_at":"2026-06-30T12:24:39.261088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-04T00:38:33.708836Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:6b0dae3f5007622498b4db3c516b4ca8264527be9d4ddbcb0518b71576a7bf34","observation_id":"a72629b2-ab5b-4326-9104-a826e9231761","resolution":{"observed_at":"2026-07-04T00:39:16.236947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-14T18:45:28.635910Z","title":"Next token predic- tion towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.24956","last_updated":"2026-07-12T09:24:31Z","snapshot_observed_at":"2026-08-07T14:43:53.645603Z","submitted_at":"2026-05-24T09:13:12Z","title":"NITP: Next Implicit Token Prediction for LLM Pre-training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T18:45:28.635910Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.24956"},"observation_digest":"sha256:e743fb6a64212714efb6258d3ae98fe3865f3d003fd521d9adaed97de62e3e4f","observation_id":"1c3ab298-d7ac-4ac3-b52e-158f88d19a75","resolution":{"observed_at":"2026-07-14T18:45:28.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:92aff31071d5c2eeeb42740c1af481cfb2b3ead690f635da5fdaba5ab86716a6","observation_id":"9765716f-0b0e-46d2-85c9-50c56f27fb6f","resolution":{"observed_at":"2026-06-29T23:04:02.082867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2606.01543","last_updated":"2026-06-01T01:43:48Z","snapshot_observed_at":"2026-08-02T11:53:58.847340Z","submitted_at":"2026-06-01T01:43:48Z","title":"PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:50:54.950899Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2606.01543"},"observation_digest":"sha256:60cb8e8c65ac8d3796d2e7b0b381b1492fe102783f71f01369a91f14f504ae23","observation_id":"7d2e77ea-d6c9-45b9-921d-c920dc26abb9","resolution":{"observed_at":"2026-07-01T22:06:15.887435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2412.18619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18619","snapshot_observed_at":"2026-07-04T00:39:16.234771Z","title":"Next token prediction towards multimodal intelligence: A comprehensive survey.arXiv preprint arXiv:2412.18619, 2024a","venue":null,"work_id":"5cdd7b0b-6c98-4848-901b-eab0a5c3f9e6","year":2024},"citing_paper":{"arxiv_id":"2606.18060","last_updated":"2026-06-16T15:37:02Z","snapshot_observed_at":"2026-08-03T13:40:03.995669Z","submitted_at":"2026-06-16T15:37:02Z","title":"PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T01:29:12.725865Z"},"links":{"cited_paper":"/paper/2412.18619","citing_paper":"/paper/2606.18060"},"observation_digest":"sha256:43b69abde3855d35be5662fa3345d07b774263db82920ef0987b0956d703cced","observation_id":"91cf0468-9629-4d60-b85b-94d377b9ac20","resolution":{"observed_at":"2026-07-03T20:18:56.449179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18619/citation-record","integrity":"/paper/2412.18619/integrity","json":"/paper/2412.18619/citation-record.json","paper":"/paper/2412.18619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T14:59:01.080247Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.080247Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e74f1c0e5063d1fb4178e0fe5c0c70b186e6f38d095e9d342ce35f5125f71c91","observation_id":"fe62bfa2-1b26-40e0-abd8-3c868a84bda5","resolution":{"observed_at":"2026-08-11T14:59:01.080247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03728","last_updated":"2023-01-10T00:20:06Z","snapshot_observed_at":"2026-08-11T23:16:35.348461Z","submitted_at":"2023-01-10T00:20:06Z","title":"Scaling Laws for Generative Mixed-Modal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03728","snapshot_observed_at":"2026-08-11T14:59:01.086427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.086427Z"},"links":{"cited_paper":"/paper/2301.03728","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:4e777c66da9868510fc42f6e47ea6891579ec24acff93007adc5fb7066c14dae","observation_id":"b4cc7ec8-41c0-4af7-9a63-c219aa932e09","resolution":{"observed_at":"2026-08-11T14:59:01.086427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.091260Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.091260Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:02cd05f3362f57d6b7a5aa8e4e8dc259d28b7097c376bf3c89e060d5a181f401","observation_id":"1a3ce445-1301-4bf8-9187-1b1097c61834","resolution":{"observed_at":"2026-08-11T14:59:01.091260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-11T14:59:01.095616Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.095616Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e0c7ce11b1954c11d70d1cada486044a0c22f1cdaef27b24ea9fe517045a3da1","observation_id":"0c1fa7b2-a107-4df9-9f86-44bf8b70492c","resolution":{"observed_at":"2026-08-11T14:59:01.095616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.101268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.101268Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:ce6396123ae20b0f583be295cfd213178b3131e6a7b3b919e0b88720c7ffbeb2","observation_id":"03472a17-98a7-49ce-a5fd-cf900033a055","resolution":{"observed_at":"2026-08-11T14:59:01.101268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15691","last_updated":"2021-11-01T12:55:56Z","snapshot_observed_at":"2026-08-06T03:32:00.098200Z","submitted_at":"2021-03-29T15:27:17Z","title":"ViViT: A Video Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15691","snapshot_observed_at":"2026-08-11T14:59:01.107233Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.107233Z"},"links":{"cited_paper":"/paper/2103.15691","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:fb75012e676f85b3c5363ef3062cf4424c1805158a8fa0b01b08577e8b929cdb","observation_id":"9dcf01d1-605b-4013-9a10-6db96d4dc130","resolution":{"observed_at":"2026-08-11T14:59:01.107233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T14:59:01.114006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.114006Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5f1f1a8934ff9a9dabe4a4c5332b2113c8127b7abed5190236e96b654b70e442","observation_id":"263cd2fc-43bb-45aa-b9ec-e86db136fdcc","resolution":{"observed_at":"2026-08-11T14:59:01.114006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-07T23:40:08.386706Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-11T14:59:01.119847Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.119847Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:8611899b7d10b58328f0e7241154839d0111e162d917609c5f190aa2e9ee0391","observation_id":"6459b60f-8c96-4e45-85d3-284d2d50662c","resolution":{"observed_at":"2026-08-11T14:59:01.119847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-11T14:59:01.125368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.125368Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a5cfd55002891c554d3e984fcacc77ed9e2ccd73cb2374cd05a4db6f1b1f1ae5","observation_id":"c330543f-40bb-4fc7-9601-a6ce42b4e49f","resolution":{"observed_at":"2026-08-11T14:59:01.125368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-11T14:59:01.130923Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.130923Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:470e0f72f2e97011825d021dd18d6ab24862204b76482b6783c56e58d4b34f62","observation_id":"3eafa8b5-a3f6-48ba-b8ff-647d49e61366","resolution":{"observed_at":"2026-08-11T14:59:01.130923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.136222Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.136222Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3e5a778d70bc30911415a71427cd1843b2282725ade37467039bb03e1e1ac466","observation_id":"1e764e5a-fd2e-46fe-926f-63b6e8289d0f","resolution":{"observed_at":"2026-08-11T14:59:01.136222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.141710Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.141710Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d590e0262eddd206ef1481bb3c03e7e8f035a5a5c4c29e22e56de45fc5b0f01e","observation_id":"373672a8-a805-4518-af54-30981f20cb28","resolution":{"observed_at":"2026-08-11T14:59:01.141710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00785","last_updated":"2023-12-01T18:59:57Z","snapshot_observed_at":"2026-07-31T06:02:58.625623Z","submitted_at":"2023-12-01T18:59:57Z","title":"Sequential Modeling Enables Scalable Learning for Large Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00785","snapshot_observed_at":"2026-08-11T14:59:01.152569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.152569Z"},"links":{"cited_paper":"/paper/2312.00785","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:bfe8b367d22dfe9c9f697103fdcc0b3891fa4d8e3ee6a4021a3e82af8c61edc9","observation_id":"7fb01719-74f9-4f02-84c7-772b48d6c044","resolution":{"observed_at":"2026-08-11T14:59:01.152569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.157928Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.157928Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:7d0bab533627c518deac1019e6655d7dad7211312b2821798946749a1ec0cbc9","observation_id":"d138caa8-b876-4ec4-aba4-6e6dd832f8c4","resolution":{"observed_at":"2026-08-11T14:59:01.157928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.162518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.162518Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:07a0c10c384c1b497dd167e9fce057c8b6a13b1393fcb53cbdc23b33579aee99","observation_id":"2bb294c4-e5f9-40d2-aeaa-d7633b9eb53b","resolution":{"observed_at":"2026-08-11T14:59:01.162518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.166219Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.166219Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3478f66ff916d8cf391bc3db49d42126ebee4c9a00f6b95fb3346c715d0ca594","observation_id":"a102b79e-dabd-4371-b89e-226e17890273","resolution":{"observed_at":"2026-08-11T14:59:01.166219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-11T14:59:01.170069Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.170069Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:42b4b6165e0ff510d0a1b346728d569382ab2f465cedde4409efa9ad5fe5af43","observation_id":"943587c3-60b6-42c5-a1ba-6568e0f3d3ef","resolution":{"observed_at":"2026-08-11T14:59:01.170069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.174096Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.174096Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1f10795402096cd6f629bc9bb79bb3dcdd6d48d96b613026679516b72424a26d","observation_id":"b1630485-7c8d-4c5f-ad1a-a693d67b0385","resolution":{"observed_at":"2026-08-11T14:59:01.174096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05718","last_updated":"2024-07-15T09:57:48Z","snapshot_observed_at":"2026-08-05T16:44:32.516369Z","submitted_at":"2023-10-09T13:39:26Z","title":"EdVAE: Mitigating Codebook Collapse with Evidential Discrete Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05718","snapshot_observed_at":"2026-08-11T14:59:01.182588Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.182588Z"},"links":{"cited_paper":"/paper/2310.05718","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:b019f75e9f4f1b9ee7a4673d106ad4e15325c84fc3aaf158e40b03b85a02f051","observation_id":"fcf02090-06d2-4758-a4da-98d8d0ecf100","resolution":{"observed_at":"2026-08-11T14:59:01.182588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.178191Z","title":"https://www.adept.ai/blog/fuyu-8b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.178191Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e958d3e0bea40a48a5c7e2cc002e363bae03b90f91e0d14c0e7a4fc69dfa5787","observation_id":"4220cdff-e448-4ffb-bfbc-54a8176f4319","resolution":{"observed_at":"2026-08-11T14:59:01.178191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-11T14:59:01.192288Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.192288Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:7b1cb59d981d35b203784375f8fbffd368b0f9b81f5392872b78e4b6147a102d","observation_id":"994f7e8e-e4be-401e-ac5e-107a141be585","resolution":{"observed_at":"2026-08-11T14:59:01.192288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11435","last_updated":"2024-09-22T16:27:12Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T06:57:35Z","title":"Genomic Language Models: Opportunities and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11435","snapshot_observed_at":"2026-08-11T14:59:01.186593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.186593Z"},"links":{"cited_paper":"/paper/2407.11435","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5679f87a015f0120971388624d44b56c0bed2bb9e11c351495127948c49f02f9","observation_id":"695b1b87-6d61-4298-b09f-98076e0bb3b5","resolution":{"observed_at":"2026-08-11T14:59:01.186593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.202000Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.202000Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e017c47ecf114db13720207d49096ac7333290b130f9e26c583998041e35f78b","observation_id":"e2c93187-8fd5-4da0-9876-046d72576dae","resolution":{"observed_at":"2026-08-11T14:59:01.202000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.197269Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.197269Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:f39f36c7f0d642f65468ee2cc4edb83e48dd7119a26c06cb18a8cb0b86cc8ca6","observation_id":"d399fe51-903e-4251-9345-031d01894d7e","resolution":{"observed_at":"2026-08-11T14:59:01.197269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.211479Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.211479Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:2df0b83a0d1f94009fea321c698dd7278271d682d510bcdff2257ccfc60aed14","observation_id":"1c498f43-f05c-4559-93bd-fb15597138c6","resolution":{"observed_at":"2026-08-11T14:59:01.211479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08013","last_updated":"2023-03-23T21:38:16Z","snapshot_observed_at":"2026-08-09T22:43:06.519305Z","submitted_at":"2022-12-15T18:18:38Z","title":"FlexiViT: One Model for All Patch Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08013","snapshot_observed_at":"2026-08-11T14:59:01.206564Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.206564Z"},"links":{"cited_paper":"/paper/2212.08013","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:4893f5c6cd8c50ca2e912e6a1c9ea37291039cb292846c4aef05f1195a1909bd","observation_id":"5bb286b1-8954-429f-94cf-c25a58142809","resolution":{"observed_at":"2026-08-11T14:59:01.206564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-11T09:47:06.410749Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-11T14:59:01.220651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.220651Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:520a978ef7891189cb0e93911cc95638e8abb03f6d33434f5cef878fd5460019","observation_id":"22e5f17f-4e8f-4e64-ac9d-45df9075c80d","resolution":{"observed_at":"2026-08-11T14:59:01.220651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.215920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.215920Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1efb2d36b248fc0132430cc05966ec4c6d4d46090aeb916aec60f70b03153334","observation_id":"92bf95ea-9dfa-4a06-9907-c1f8e28c1746","resolution":{"observed_at":"2026-08-11T14:59:01.215920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.231103Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.231103Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:21b5cad08b600453d935e83c01f32b21698e65f27b5a77940781433be487d320","observation_id":"83b81543-e664-4409-bf0e-23b8fc776b8b","resolution":{"observed_at":"2026-08-11T14:59:01.231103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.225979Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.225979Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:6f239de928550bdd6d2d4f0be2779987b331e21188ce54e2fc9f5d7bbe2df0a7","observation_id":"5253f172-e446-446c-97ef-5d69979731d1","resolution":{"observed_at":"2026-08-11T14:59:01.225979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06171","last_updated":"2021-02-11T18:23:20Z","snapshot_observed_at":"2026-08-11T18:32:33.968297Z","submitted_at":"2021-02-11T18:23:20Z","title":"High-Performance Large-Scale Image Recognition Without Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06171","snapshot_observed_at":"2026-08-11T14:59:01.240944Z","title":"Smith, and Karen Simonyan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.240944Z"},"links":{"cited_paper":"/paper/2102.06171","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3d4b36db5637086a65e322fa327652f3469c57fbef221a99933ffb852036b3c0","observation_id":"efc3ee0d-2ed7-46d2-96d5-26f980be3a43","resolution":{"observed_at":"2026-08-11T14:59:01.240944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.236113Z","title":"Smith, and K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.236113Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:6d503a95e7050bbae9299c4a80a4a332105307c110ab2836b9478328eca400ab","observation_id":"baa19661-bcab-4874-bfba-0f709cdfda9e","resolution":{"observed_at":"2026-08-11T14:59:01.236113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.250696Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.250696Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e6823b3bc972a16dad8fd673f5eee6bc1604e5234828cb42d03e3a3ad5424644","observation_id":"bf7f4559-310e-4756-8883-351bd9fd997e","resolution":{"observed_at":"2026-08-11T14:59:01.250696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T14:59:01.245779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.245779Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:7a156f9deaf565c4034f53e3a847a57308b5840a6ad86c4e2727efbe81348636","observation_id":"ce96daae-8f69-4ae3-b931-b06f74a29a5f","resolution":{"observed_at":"2026-08-11T14:59:01.245779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.260501Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.260501Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:bc1f871c7e251a9815f42ea2448f3d0d4f1b6faab924e95e73792949f3f3e531","observation_id":"4d870116-35a3-429c-bc1f-8198808588bb","resolution":{"observed_at":"2026-08-11T14:59:01.260501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.255735Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.255735Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1cf690898b748790b10da5edbfaff40a27add9c8d322aff4f70ff1775e2a8296","observation_id":"3b539719-cc6b-4936-a75f-c2b827ad5d1f","resolution":{"observed_at":"2026-08-11T14:59:01.255735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","snapshot_observed_at":"2026-08-08T15:49:58.059599Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02896","snapshot_observed_at":"2026-08-11T14:59:01.270436Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.270436Z"},"links":{"cited_paper":"/paper/2312.02896","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:ea0f1c83817b00be7a2e0a00d673ff11a3a1dace28767ce6aaf03b08aa3ced0d","observation_id":"bf20845d-9085-4825-937d-cee5b6560c3c","resolution":{"observed_at":"2026-08-11T14:59:01.270436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.265306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.265306Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:6deb6f29d627954560980c6d1c2e3e68cecf0c4e3558c4e24d7652d1955b3814","observation_id":"42ea5248-9941-47dd-b393-ab422385372a","resolution":{"observed_at":"2026-08-11T14:59:01.265306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05400","last_updated":"2023-10-09T04:38:52Z","snapshot_observed_at":"2026-08-12T05:00:37.143051Z","submitted_at":"2023-10-09T04:38:52Z","title":"Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05400","snapshot_observed_at":"2026-08-11T14:59:01.280625Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.280625Z"},"links":{"cited_paper":"/paper/2310.05400","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5b3924567baffc70979c741ac9461a0f2fa7013f4bbb87c3315c390fccb8f1ee","observation_id":"de3d030a-a87c-4f1b-a65e-2bf53078ce43","resolution":{"observed_at":"2026-08-11T14:59:01.280625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05537","last_updated":"2021-05-12T09:30:26Z","snapshot_observed_at":"2026-07-06T11:08:42.400145Z","submitted_at":"2021-05-12T09:30:26Z","title":"Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05537","snapshot_observed_at":"2026-08-11T14:59:01.275746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.275746Z"},"links":{"cited_paper":"/paper/2105.05537","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:443d1ad1e4bca3e0e60297c5248c9a99479cb0d82a6688cab2b5370ea60ee033","observation_id":"a0b8e8c7-7211-42d6-a8fd-4e467016079d","resolution":{"observed_at":"2026-08-11T14:59:01.275746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10890","last_updated":"2022-11-03T18:34:02Z","snapshot_observed_at":"2026-08-12T04:01:30.247932Z","submitted_at":"2022-02-22T13:39:14Z","title":"HiP: Hierarchical Perceiver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10890","snapshot_observed_at":"2026-08-11T14:59:01.288757Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.288757Z"},"links":{"cited_paper":"/paper/2202.10890","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:2490f2106d512f5fc4a84c8dbc349e98c249fb3a36ca3ab3f5c05486d958a64b","observation_id":"f9279ae2-6997-4be2-97b8-0108a3bb73af","resolution":{"observed_at":"2026-08-11T14:59:01.288757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-08-11T14:59:01.284652Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.284652Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1440f2d05a904226ec8e436a0826a01f155f34f3f0ad6ce9d65925974ed6ff90","observation_id":"c197ba0d-30aa-483c-8317-a26c04dff6b4","resolution":{"observed_at":"2026-08-11T14:59:01.284652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-11T14:59:01.298092Z","title":"Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.298092Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:dab995e2d542ce514da895c8c296f01fd571269060034b98235fb31ea51c1030","observation_id":"4e624e75-ff56-41b5-a1f9-609262452040","resolution":{"observed_at":"2026-08-11T14:59:01.298092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09717","last_updated":"2024-02-15T05:22:04Z","snapshot_observed_at":"2026-08-02T21:09:22.790607Z","submitted_at":"2024-02-15T05:22:04Z","title":"Visually Dehallucinative Instruction Generation: Know What You Don't Know","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09717","snapshot_observed_at":"2026-08-11T14:59:01.292865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.292865Z"},"links":{"cited_paper":"/paper/2402.09717","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:6d074d99ab81d91781385be17c58bc8d5ab878e85d1d2ae8e642bce0c2f1d20b","observation_id":"9b2593d1-89a4-43a1-9aeb-8102f872e5da","resolution":{"observed_at":"2026-08-11T14:59:01.292865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.307983Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.307983Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5c1d40bec263785975fa1862f2236f57cfb97ac7bafed187d6bad98e60e44240","observation_id":"cfd7f0a2-aeae-41e3-b9a7-dcbcdce6b204","resolution":{"observed_at":"2026-08-11T14:59:01.307983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.302942Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.302942Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d23f4566dab676a3af4b3601910bcc2652900a2a8788919625326a392f3ab48d","observation_id":"00c77c29-e841-4869-aaf9-5b2ca1facf7c","resolution":{"observed_at":"2026-08-11T14:59:01.302942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-11T14:59:01.317416Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.317416Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a130fdda7150356792a768eb3729445def9f5faddd3a6292d2907a0483eb6190","observation_id":"3571d774-5637-4e09-9f45-b0f0e67b5213","resolution":{"observed_at":"2026-08-11T14:59:01.317416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01003","last_updated":"2023-12-15T10:09:58Z","snapshot_observed_at":"2026-08-10T14:47:27.379458Z","submitted_at":"2023-07-03T13:37:00Z","title":"Visual Instruction Tuning with Polite Flamingo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01003","snapshot_observed_at":"2026-08-11T14:59:01.312675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.312675Z"},"links":{"cited_paper":"/paper/2307.01003","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:dbdfb92f2934f4eda40d12106d0fcd71f84f32e44375c7a5dd56b6d12c879344","observation_id":"d0e2a89c-0f8e-4332-b173-843d15a89ea6","resolution":{"observed_at":"2026-08-11T14:59:01.312675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.327041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.327041Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:01322bf3a11a4a5eeb5ee2e416fd4578fb7379f38a6634b9ab0ad52a67471296","observation_id":"bd089ad7-cb8e-41bc-844b-29e6d0413fef","resolution":{"observed_at":"2026-08-11T14:59:01.327041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T14:59:01.322175Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.322175Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0ba89e2a37e10ffad93e0b7922c05bd299fa5d7e13ef936c32d0719e9f1e50b7","observation_id":"c846a0c2-7942-4035-9215-f616b19fe0a9","resolution":{"observed_at":"2026-08-11T14:59:01.322175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01912","last_updated":"2024-10-02T18:10:05Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T18:10:05Z","title":"A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01912","snapshot_observed_at":"2026-08-11T14:59:01.336510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.336510Z"},"links":{"cited_paper":"/paper/2410.01912","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d217281afd8551be127efe7994b47cbbed8a5d7172f6a5318722aa481a32d1ff","observation_id":"ab33ce5c-f8f6-4b53-a49d-96c561f8e8be","resolution":{"observed_at":"2026-08-11T14:59:01.336510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T14:59:01.331481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.331481Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5c1b0b55e192bee98ae382d1714abacd164a63e21c49a5060659ae729b66af86","observation_id":"b8276a3e-45ec-4053-afcf-cc6c492fa4e0","resolution":{"observed_at":"2026-08-11T14:59:01.331481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-11T21:02:34.190923Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-11T14:59:01.346015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.346015Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:2e1968ad486fdf109ec9b60f6811e53bc73521665f2b2a27c2caa832f86b86ec","observation_id":"fc3de712-dac5-4d35-9584-7f13d4cbd7dc","resolution":{"observed_at":"2026-08-11T14:59:01.346015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.341773Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.341773Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:543a89d112282c377e9b8ae3c0ef580190dc17959167e4789d1b8da60e0dd375","observation_id":"c38a2aaa-97f6-430c-9b2e-740de6224856","resolution":{"observed_at":"2026-08-11T14:59:01.341773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.354807Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.354807Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d7e852e0a60eecafe2b9d16f781de9cbd80e664c836a25a6cb2b42eaeb1c4368","observation_id":"c902bd1b-f8df-4cc8-b0c7-e350b849d8d4","resolution":{"observed_at":"2026-08-11T14:59:01.354807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T14:59:01.350120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.350120Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0ab0fded36693d59cc1d223898b468b8e4df71825458b9185339390df0746b00","observation_id":"f29064d1-35f5-4560-81fa-fbeecb340d41","resolution":{"observed_at":"2026-08-11T14:59:01.350120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-11T14:59:01.369162Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.369162Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:aba602975df01b8fdf948abf72c3cbf15cc7cc468e1dee2f46f95dc7405884dd","observation_id":"07018219-5482-4790-8ca2-1dce466a6770","resolution":{"observed_at":"2026-08-11T14:59:01.369162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.374638Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.374638Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:15ceb46fa6599a9ba254d3229b11557be115df6b37c8964ec3d5ef29b7dbff85","observation_id":"13f12c5e-a11f-4e44-a4cd-0edf5c0fda77","resolution":{"observed_at":"2026-08-11T14:59:01.374638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.364278Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.364278Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:bb3e70cc12dcdf9daf93483e5bb9fa08e7ff06ba74b04f1dfef80798968f441f","observation_id":"509b8f1b-44d0-4033-88a3-3f49e6176625","resolution":{"observed_at":"2026-08-11T14:59:01.364278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T14:59:01.389504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.389504Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:f20e29b57a7c91e97558bccb15ba076d105975f9495f752c54382bf01bd7f27b","observation_id":"e7257bb8-252f-4140-81b7-0b8aad065ed7","resolution":{"observed_at":"2026-08-11T14:59:01.389504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-08T01:21:54.937517Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T14:59:01.379180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.379180Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:933dbae925c0658523a93e7a14caf228b41898b4ccc13a107e6e8e4c9feff2dc","observation_id":"75fee6e8-3154-41aa-9617-1ab5e12fcb06","resolution":{"observed_at":"2026-08-11T14:59:01.379180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.398122Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.398122Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:eb3a95df984e3c434ad037c8d08e071928d5b132cdf85b49cc130c70aafb8bdb","observation_id":"cc0af5e5-0672-4f6d-9f7c-4119c6531bf5","resolution":{"observed_at":"2026-08-11T14:59:01.398122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.401875Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.401875Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0315903b984aa12caed7b23b2f2437f21e0159bcce57c72f78e9b6f5dc1dc687","observation_id":"cd8c3b4d-786f-47fb-a49a-916c31af0e49","resolution":{"observed_at":"2026-08-11T14:59:01.401875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-11T14:59:01.393986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.393986Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:2dfda4638bf4cb4f3e1b02a5179f19a21fe8656af181224425056cef5a6ebb8a","observation_id":"badb4c3c-3c3e-4faa-a453-53460556e332","resolution":{"observed_at":"2026-08-11T14:59:01.393986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.409466Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.409466Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:8afd9c3391b8091041643100c103070c147e6b70c98c6c37b84e830725d31c50","observation_id":"72a67477-9312-4982-9d53-88482032ab57","resolution":{"observed_at":"2026-08-11T14:59:01.409466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.413324Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.413324Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:598e25666ed750ff239023b4d67b05353767b5eadd4cb626a087e9bd459fad22","observation_id":"afc1ca31-d0c4-4bb0-a47d-e4234d407cd6","resolution":{"observed_at":"2026-08-11T14:59:01.413324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-11T14:59:01.405469Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.405469Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:2eaee4586df1a671996b7b0af553b2453e4b6129a1823b8f67ed250345f83ceb","observation_id":"82f325f2-ca7f-45ae-a15e-fc1f267be666","resolution":{"observed_at":"2026-08-11T14:59:01.405469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.422391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.422391Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:4ddb5e28e793bf7cb95500c95133225efb74d9b344e72e2c96e8a145799930ec","observation_id":"53164fe2-376f-4cf1-bf58-52ad0b1476d4","resolution":{"observed_at":"2026-08-11T14:59:01.422391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.427039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.427039Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:75dd88ff4dde627e3b58e01b5aeac4e94a352aeb0f05e3c291ed803f3a8134ac","observation_id":"deaa9bcf-89b0-4249-96e5-2573fc335e86","resolution":{"observed_at":"2026-08-11T14:59:01.427039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T14:59:01.417462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.417462Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:87156cb264c38f33b29cd9960dcb4bfb1939f03390776a3aae88b3fbf28cae3f","observation_id":"68ce523b-cb59-4d82-8f46-03f9ff65477d","resolution":{"observed_at":"2026-08-11T14:59:01.417462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12320","last_updated":"2023-11-21T03:32:01Z","snapshot_observed_at":"2026-08-10T22:53:19.877129Z","submitted_at":"2023-11-21T03:32:01Z","title":"A Survey on Multimodal Large Language Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12320","snapshot_observed_at":"2026-08-11T14:59:01.436221Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.436221Z"},"links":{"cited_paper":"/paper/2311.12320","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:7818f1131229d3e21cc31bd485b7cecf20e04e6c92b00d935e31f4f4f41c736a","observation_id":"3c62bd7f-0bd4-493b-86e1-a4b6e785a9fb","resolution":{"observed_at":"2026-08-11T14:59:01.436221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-08-10T17:39:51.703002Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-11T14:59:01.441016Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.441016Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:9cea78aecb1bfe7a9adc62bf40b1282522c733d0f1166d55f72fa689085dbfd9","observation_id":"2e138070-41d0-4e3f-bdc8-b36ac86a8f5a","resolution":{"observed_at":"2026-08-11T14:59:01.441016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09796","last_updated":"2020-09-10T19:31:04Z","snapshot_observed_at":"2026-08-09T08:30:49.737024Z","submitted_at":"2020-09-10T19:31:04Z","title":"Multi-Task Learning with Deep Neural Networks: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09796","snapshot_observed_at":"2026-08-11T14:59:01.431584Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.431584Z"},"links":{"cited_paper":"/paper/2009.09796","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:390c05accf8308015032130ebedd1a92360cffa7b1881d80dcdad25b591ca549","observation_id":"53ade0a4-d6bb-4f8e-a636-6bac7e340233","resolution":{"observed_at":"2026-08-11T14:59:01.431584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-11T14:59:01.450626Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.450626Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3adc48f819a07f7d1354d7347e87e6e0d8e7e904eab730dbb699ce4f23747239","observation_id":"8a2514d9-6259-4e23-8457-c78eed1d483a","resolution":{"observed_at":"2026-08-11T14:59:01.450626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T14:59:01.455567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.455567Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:03d20afcf31923b70615b73871550e874027227425b60abde661a86d479bc88d","observation_id":"0137b1e5-542f-4dbf-a1c7-5b910742c6b6","resolution":{"observed_at":"2026-08-11T14:59:01.455567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T14:59:01.445953Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.445953Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0b4e2c079d886b88f80df8c3788d4e57ff4f1795d5155986f94f28a684dca2de","observation_id":"00e51334-ec3f-4805-9bce-1ce34438fdb4","resolution":{"observed_at":"2026-08-11T14:59:01.445953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.470063Z","title":"Heek, Matthias Minderer, Mathilde Caron, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.470063Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:eb95f74438d93b940efb46e30a1b44e3bb29b8fc8d128395c7c2dc9a5a39247c","observation_id":"cf1f6e1d-f5f4-45a2-a2ad-888079543368","resolution":{"observed_at":"2026-08-11T14:59:01.470063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-11T14:59:01.460484Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.460484Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:21fbd7538c21ee064d77a1b5ea570a5576570fa1eded3bcc7b9d994b9d919e18","observation_id":"7f1a0eae-bc95-49e0-94b6-db766ed7b782","resolution":{"observed_at":"2026-08-11T14:59:01.460484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11431","last_updated":"2021-11-22T18:59:34Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:34Z","title":"RedCaps: web-curated image-text data created by the people, for the people","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11431","snapshot_observed_at":"2026-08-11T14:59:01.484638Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.484638Z"},"links":{"cited_paper":"/paper/2111.11431","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:c8a18454c1cee199ba808e3bc2d2c493a4f349ce09bf2c29f87a9505e8477443","observation_id":"fa457102-9ce3-46ca-8299-d1935f06b996","resolution":{"observed_at":"2026-08-11T14:59:01.484638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.488476Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.488476Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1f0c48eb6cae0b347d48f15825ff2d5e26e8f9eba40ab7f80807a0bb624900f5","observation_id":"a55c6631-90df-4e81-a2a6-0f00f8b09eba","resolution":{"observed_at":"2026-08-11T14:59:01.488476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-11T14:59:01.475206Z","title":"Neural Information Processing Systems (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.475206Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:9874fa5ef97459db1719ebcf049d10ab125118bf4546a9a9d128ff5112f8af5c","observation_id":"765fec69-3ccf-437c-8bda-76cccfd07904","resolution":{"observed_at":"2026-08-11T14:59:01.475206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-11T14:59:01.480020Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.480020Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a649765851b4e0c4cc0123cea481de63ba65c4617a478d3f98799021c7176705","observation_id":"1fc8a169-2507-4ff8-bdd8-d04f010a0bef","resolution":{"observed_at":"2026-08-11T14:59:01.480020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-11T14:59:01.500382Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.500382Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3a9776d1f45dc973df02213bad5a8a1568b43c92b405f8beea255e1e1a0b8f7b","observation_id":"633b3996-342d-4b91-a586-7ff45ee4dde0","resolution":{"observed_at":"2026-08-11T14:59:01.500382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-11T14:59:01.504454Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.504454Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:9c82802b7edad07bef35e844e0825aa121e251681ba5f4b52ef47e7b0a25186b","observation_id":"8b092bff-42bc-475a-83b8-3cde6722c081","resolution":{"observed_at":"2026-08-11T14:59:01.504454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-11T14:59:01.492409Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.492409Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:58b49668d596ee82c9b8dfd7361139433787857e38ef17120dbbbc6a1a9e2ca8","observation_id":"9f9ae898-7e3e-4421-b8b5-47f009d353fc","resolution":{"observed_at":"2026-08-11T14:59:01.492409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.496489Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.496489Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a355018164a9f6c701debc3b96255f33a0106bbe1f46a490de8ff897b7b351fe","observation_id":"0db26017-e73b-4b5a-bbd4-f65a0efcc41d","resolution":{"observed_at":"2026-08-11T14:59:01.496489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08200","last_updated":"2017-11-22T10:01:37Z","snapshot_observed_at":"2026-08-10T07:57:13.279463Z","submitted_at":"2017-11-22T10:01:37Z","title":"Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08200","snapshot_observed_at":"2026-08-11T14:59:01.518521Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.518521Z"},"links":{"cited_paper":"/paper/1711.08200","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e05ae01a75b69d57ed205b9d21ddce745436cfc51b9de7c12684bfa85d03a3d5","observation_id":"30957332-f18c-47c2-8655-5cd706c375cb","resolution":{"observed_at":"2026-08-11T14:59:01.518521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.523561Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.523561Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:c68dc1dba9587a349dad6ad11d289a5212358267259f9821b2c62df696986884","observation_id":"9348cce5-7787-4b82-a51d-f789edf73607","resolution":{"observed_at":"2026-08-11T14:59:01.523561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T14:59:01.509004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.509004Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:5a494a26ea394fc56febd57302f4571b6ae30e20fdbfa121638a354dc55cf625","observation_id":"45336d13-7523-4ecb-a115-66b85f1dd4c4","resolution":{"observed_at":"2026-08-11T14:59:01.509004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.513974Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.513974Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a9c082af802aeba7ab6c03a171aea97eab7ab74921657784cee9de63ada59199","observation_id":"363f135a-4496-4ee9-8fe1-47b4341fa4e6","resolution":{"observed_at":"2026-08-11T14:59:01.513974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-11T14:59:01.537265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.537265Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:94c8b5cdb42690c1444c22cdd46384f13ded5a72536208b43d31ed800ed6ff2a","observation_id":"3426ff5a-082f-44e3-a0a9-3a0b7ff33c0e","resolution":{"observed_at":"2026-08-11T14:59:01.537265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T14:59:01.542017Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.542017Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:3d585bd72036b83e12317973f9110b37bed3b484b46d4e56ec0066aedade7d48","observation_id":"5d98913d-cb37-4594-b764-ac87293184d3","resolution":{"observed_at":"2026-08-11T14:59:01.542017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.528111Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.528111Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:21ba8736d96960fec73378537d95c61a8b4f9ae8db72ad4c38dde6c9d0ba3ee9","observation_id":"7077c327-7bbb-428a-af1d-e3db90907591","resolution":{"observed_at":"2026-08-11T14:59:01.528111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.532673Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.532673Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d05a0bfe85d91d90597083ede39a25fc7182cbb38a68e3c8c2f2bc41e81439d1","observation_id":"13641ca5-614b-440a-8b41-d66e6fd25f4b","resolution":{"observed_at":"2026-08-11T14:59:01.532673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T14:59:01.556420Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.556420Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:dd450ef409df20a1889e6b91d8561ccd858087d5f76289a020a80a826341e249","observation_id":"f9d7d0b9-eec7-4b4c-93b5-4edc22129e86","resolution":{"observed_at":"2026-08-11T14:59:01.556420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:59:01.561434Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.561434Z"},"links":{"citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:88339b03682a9fd302623fd2a16b5013399e8c2222da4b7ad8451c310a820291","observation_id":"469ec685-3bfb-4f72-8275-502b27fef095","resolution":{"observed_at":"2026-08-11T14:59:01.561434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-11T14:59:01.546678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.546678Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:226fc6faf3e027f70a5776d054bd3e60129977d4b6ed0c72154a47bdf439267e","observation_id":"b820cdd7-daab-4380-885b-ae0376eb4fff","resolution":{"observed_at":"2026-08-11T14:59:01.546678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T14:59:01.551495Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.551495Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:eb36c82c84b6b74944bcbf6e05101410d7de1ae7eb9cd8ac0bcee00e98ebbd63","observation_id":"0e19db84-16ba-4bf2-81e9-d598746136d2","resolution":{"observed_at":"2026-08-11T14:59:01.551495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-11T14:59:01.576272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.576272Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e308ef9586f38fc89a11e7dd3fc54b2a01836dad240c46d239fd3ba55680d1e9","observation_id":"d945b4da-fc3e-4a39-b2fb-33fc5d52be69","resolution":{"observed_at":"2026-08-11T14:59:01.576272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-10T13:50:38.422341Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-11T14:59:01.581000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.581000Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0e43ce12c8916fdcbf96c67f8c0f623282c07848cd2d11f0991779c23055b5e6","observation_id":"5a9409a4-187f-48ff-9a6d-3cffe028e505","resolution":{"observed_at":"2026-08-11T14:59:01.581000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":292},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 292 outbound references and 17 inbound Pith citation observations for arXiv:2412.18619."}