Pith. sign in

Paper Citation Record · LEDGER

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

As of 12 August 2026, this Paper Citation Record lists 100 of 292 outbound references and 17 inbound Pith citation observations for arXiv:2412.18619.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.18619 v2

Coverage vector

measured 100 of 292 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T14:59:01.581000Z

measured 117 of 117 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 17 of 17 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T11:42:31.574249Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:39:16.234771Z

Reference resolution

100 of 292 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved100
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fe62bfa2-1b26-40e0-abd8-3c868a84bda5 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.080247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.080247Z digest=sha256:e74f1c0e5063d1fb4178e0fe5c0c70b186e6f38d095e9d342ce35f5125f71c91

Observation b4cc7ec8-41c0-4af7-9a63-c219aa932e09 · outbound

This paper cites Scaling Laws for Generative Mixed-Modal Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Scaling Laws for Generative Mixed-Modal Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.086427Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.086427Z digest=sha256:4e777c66da9868510fc42f6e47ea6891579ec24acff93007adc5fb7066c14dae

Observation 1a3ce445-1301-4bf8-9187-1b1097c61834 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.091260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.091260Z digest=sha256:02cd05f3362f57d6b7a5aa8e4e8dc259d28b7097c376bf3c89e060d5a181f401

Observation 0c1fa7b2-a107-4df9-9f86-44bf8b70492c · outbound

This paper cites Seed-TTS: A Family of High-Quality Versatile Speech Generation Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.095616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.095616Z digest=sha256:e0c7ce11b1954c11d70d1cada486044a0c22f1cdaef27b24ea9fe517045a3da1

Observation 03472a17-98a7-49ce-a5fd-cf900033a055 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.101268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.101268Z digest=sha256:ce6396123ae20b0f583be295cfd213178b3131e6a7b3b919e0b88720c7ffbeb2

Observation 9dcf01d1-605b-4013-9a10-6db96d4dc130 · outbound

This paper cites ViViT: A Video Vision Transformer.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey ViViT: A Video Vision Transformer

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.107233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.107233Z digest=sha256:fb75012e676f85b3c5363ef3062cf4424c1805158a8fa0b01b08577e8b929cdb

Observation 263cd2fc-43bb-45aa-b9ec-e86db136fdcc · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.114006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.114006Z digest=sha256:5f1f1a8934ff9a9dabe4a4c5332b2113c8127b7abed5190236e96b654b70e442

Observation 6459b60f-8c96-4e45-85d3-284d2d50662c · outbound

This paper cites Foundational Models Defining a New Era in Vision: A Survey and Outlook.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Foundational Models Defining a New Era in Vision: A Survey and Outlook

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.119847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.119847Z digest=sha256:8611899b7d10b58328f0e7241154839d0111e162d917609c5f190aa2e9ee0391

Observation c330543f-40bb-4fc7-9601-a6ce42b4e49f · outbound

This paper cites data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.125368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.125368Z digest=sha256:a5cfd55002891c554d3e984fcacc77ed9e2ccd73cb2374cd05a4db6f1b1f1ae5

Observation 3eafa8b5-a3f6-48ba-b8ff-647d49e61366 · outbound

This paper cites vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.130923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.130923Z digest=sha256:470e0f72f2e97011825d021dd18d6ab24862204b76482b6783c56e58d4b34f62

Observation 1e764e5a-fd2e-46fe-926f-63b6e8289d0f · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.136222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.136222Z digest=sha256:3e5a778d70bc30911415a71427cd1843b2282725ade37467039bb03e1e1ac466

Observation 373672a8-a805-4518-af54-30981f20cb28 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.141710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.141710Z digest=sha256:d590e0262eddd206ef1481bb3c03e7e8f035a5a5c4c29e22e56de45fc5b0f01e

Observation 7fb01719-74f9-4f02-84c7-772b48d6c044 · outbound

This paper cites Sequential Modeling Enables Scalable Learning for Large Vision Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Sequential Modeling Enables Scalable Learning for Large Vision Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.152569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.152569Z digest=sha256:bfe8b367d22dfe9c9f697103fdcc0b3891fa4d8e3ee6a4021a3e82af8c61edc9

Observation d138caa8-b876-4ec4-aba4-6e6dd832f8c4 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.157928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.157928Z digest=sha256:7d0bab533627c518deac1019e6655d7dad7211312b2821798946749a1ec0cbc9

Observation 2bb294c4-e5f9-40d2-aeaa-d7633b9eb53b · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.162518Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.162518Z digest=sha256:07a0c10c384c1b497dd167e9fce057c8b6a13b1393fcb53cbdc23b33579aee99

Observation a102b79e-dabd-4371-b89e-226e17890273 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.166219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.166219Z digest=sha256:3478f66ff916d8cf391bc3db49d42126ebee4c9a00f6b95fb3346c715d0ca594

Observation 943587c3-60b6-42c5-a1ba-6568e0f3d3ef · outbound

This paper cites BEiT: BERT Pre-Training of Image Transformers.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey BEiT: BERT Pre-Training of Image Transformers

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.170069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.170069Z digest=sha256:42b4b6165e0ff510d0a1b346728d569382ab2f465cedde4409efa9ad5fe5af43

Observation b1630485-7c8d-4c5f-ad1a-a693d67b0385 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.174096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.174096Z digest=sha256:1f10795402096cd6f629bc9bb79bb3dcdd6d48d96b613026679516b72424a26d

Observation fcf02090-06d2-4758-a4da-98d8d0ecf100 · outbound

This paper cites EdVAE: Mitigating Codebook Collapse with Evidential Discrete Variational Autoencoders.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey EdVAE: Mitigating Codebook Collapse with Evidential Discrete Variational Autoencoders

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.182588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.182588Z digest=sha256:b019f75e9f4f1b9ee7a4673d106ad4e15325c84fc3aaf158e40b03b85a02f051

Observation 4220cdff-e448-4ffb-bfbc-54a8176f4319 · outbound

This paper cites https://www.adept.ai/blog/fuyu-8b.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey https://www.adept.ai/blog/fuyu-8b

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.178191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.178191Z digest=sha256:e958d3e0bea40a48a5c7e2cc002e363bae03b90f91e0d14c0e7a4fc69dfa5787

Observation 994f7e8e-e4be-401e-ac5e-107a141be585 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.192288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.192288Z digest=sha256:7b1cb59d981d35b203784375f8fbffd368b0f9b81f5392872b78e4b6147a102d

Observation 695b1b87-6d61-4298-b09f-98076e0bb3b5 · outbound

This paper cites Genomic Language Models: Opportunities and Challenges.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Genomic Language Models: Opportunities and Challenges

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.186593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.186593Z digest=sha256:5679f87a015f0120971388624d44b56c0bed2bb9e11c351495127948c49f02f9

Observation e2c93187-8fd5-4da0-9876-046d72576dae · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.202000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.202000Z digest=sha256:e017c47ecf114db13720207d49096ac7333290b130f9e26c583998041e35f78b

Observation d399fe51-903e-4251-9345-031d01894d7e · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.197269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.197269Z digest=sha256:f39f36c7f0d642f65468ee2cc4edb83e48dd7119a26c06cb18a8cb0b86cc8ca6

Observation 1c498f43-f05c-4559-93bd-fb15597138c6 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.211479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.211479Z digest=sha256:2df0b83a0d1f94009fea321c698dd7278271d682d510bcdff2257ccfc60aed14

Observation 5bb286b1-8954-429f-94cf-c25a58142809 · outbound

This paper cites FlexiViT: One Model for All Patch Sizes.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey FlexiViT: One Model for All Patch Sizes

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.206564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.206564Z digest=sha256:4893f5c6cd8c50ca2e912e6a1c9ea37291039cb292846c4aef05f1195a1909bd

Observation 22e5f17f-4e8f-4e64-ac9d-45df9075c80d · outbound

This paper cites An Introduction to Vision-Language Modeling.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey An Introduction to Vision-Language Modeling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.220651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.220651Z digest=sha256:520a978ef7891189cb0e93911cc95638e8abb03f6d33434f5cef878fd5460019

Observation 92bf95ea-9dfa-4a06-9907-c1f8e28c1746 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.215920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.215920Z digest=sha256:1efb2d36b248fc0132430cc05966ec4c6d4d46090aeb916aec60f70b03153334

Observation 83b81543-e664-4409-bf0e-23b8fc776b8b · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.231103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.231103Z digest=sha256:21b5cad08b600453d935e83c01f32b21698e65f27b5a77940781433be487d320

Observation 5253f172-e446-446c-97ef-5d69979731d1 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.225979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.225979Z digest=sha256:6f239de928550bdd6d2d4f0be2779987b331e21188ce54e2fc9f5d7bbe2df0a7

Observation efc3ee0d-2ed7-46d2-96d5-26f980be3a43 · outbound

This paper cites High-Performance Large-Scale Image Recognition Without Normalization.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey High-Performance Large-Scale Image Recognition Without Normalization

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.240944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.240944Z digest=sha256:3d4b36db5637086a65e322fa327652f3469c57fbef221a99933ffb852036b3c0

Observation baa19661-bcab-4874-bfba-0f709cdfda9e · outbound

This paper cites Smith, and K.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Smith, and K

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.236113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.236113Z digest=sha256:6d503a95e7050bbae9299c4a80a4a332105307c110ab2836b9478328eca400ab

Observation bf7f4559-310e-4756-8883-351bd9fd997e · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.250696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.250696Z digest=sha256:e6823b3bc972a16dad8fd673f5eee6bc1604e5234828cb42d03e3a3ad5424644

Observation ce96daae-8f69-4ae3-b931-b06f74a29a5f · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.245779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.245779Z digest=sha256:7a156f9deaf565c4034f53e3a847a57308b5840a6ad86c4e2727efbe81348636

Observation 4d870116-35a3-429c-bc1f-8198808588bb · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.260501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.260501Z digest=sha256:bc1f871c7e251a9815f42ea2448f3d0d4f1b6faab924e95e73792949f3f3e531

Observation 3b539719-cc6b-4936-a75f-c2b827ad5d1f · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.255735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.255735Z digest=sha256:1cf690898b748790b10da5edbfaff40a27add9c8d322aff4f70ff1775e2a8296

Observation bf20845d-9085-4825-937d-cee5b6560c3c · outbound

This paper cites BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.270436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.270436Z digest=sha256:ea0f1c83817b00be7a2e0a00d673ff11a3a1dace28767ce6aaf03b08aa3ced0d

Observation 42ea5248-9941-47dd-b393-ab422385372a · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.265306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.265306Z digest=sha256:6deb6f29d627954560980c6d1c2e3e68cecf0c4e3558c4e24d7652d1955b3814

Observation de3d030a-a87c-4f1b-a65e-2bf53078ce43 · outbound

This paper cites Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision Transformers.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision Transformers

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.280625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.280625Z digest=sha256:3e1cd9a532f6fd2dbb9a4bd7b336e7fc9d3c003f997515c7f7d9906772695eae

Observation a0b8e8c7-7211-42d6-a8fd-4e467016079d · outbound

This paper cites Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.275746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.275746Z digest=sha256:443d1ad1e4bca3e0e60297c5248c9a99479cb0d82a6688cab2b5370ea60ee033

Observation f9279ae2-6997-4be2-97b8-0108a3bb73af · outbound

This paper cites HiP: Hierarchical Perceiver.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey HiP: Hierarchical Perceiver

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.288757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.288757Z digest=sha256:2490f2106d512f5fc4a84c8dbc349e98c249fb3a36ca3ab3f5c05486d958a64b

Observation c197ba0d-30aa-483c-8317-a26c04dff6b4 · outbound

This paper cites Emerging Properties in Self-Supervised Vision Transformers.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Emerging Properties in Self-Supervised Vision Transformers

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.284652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.284652Z digest=sha256:1440f2d05a904226ec8e436a0826a01f155f34f3f0ad6ce9d65925974ed6ff90

Observation 4e624e75-ff56-41b5-a1f9-609262452040 · outbound

This paper cites Muse: Text-To-Image Generation via Masked Generative Transformers.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Muse: Text-To-Image Generation via Masked Generative Transformers

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.298092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.298092Z digest=sha256:dab995e2d542ce514da895c8c296f01fd571269060034b98235fb31ea51c1030

Observation 9b2593d1-89a4-43a1-9aeb-8102f872e5da · outbound

This paper cites Visually Dehallucinative Instruction Generation: Know What You Don't Know.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Visually Dehallucinative Instruction Generation: Know What You Don't Know

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.292865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.292865Z digest=sha256:6d074d99ab81d91781385be17c58bc8d5ab878e85d1d2ae8e642bce0c2f1d20b

Observation cfd7f0a2-aeae-41e3-b9a7-dcbcdce6b204 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.307983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.307983Z digest=sha256:5c1d40bec263785975fa1862f2236f57cfb97ac7bafed187d6bad98e60e44240

Observation 00c77c29-e841-4869-aaf9-5b2ca1facf7c · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.302942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.302942Z digest=sha256:d23f4566dab676a3af4b3601910bcc2652900a2a8788919625326a392f3ab48d

Observation 3571d774-5637-4e09-9f45-b0f0e67b5213 · outbound

This paper cites X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.317416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.317416Z digest=sha256:a130fdda7150356792a768eb3729445def9f5faddd3a6292d2907a0483eb6190

Observation d0e2a89c-0f8e-4332-b173-843d15a89ea6 · outbound

This paper cites Visual Instruction Tuning with Polite Flamingo.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Visual Instruction Tuning with Polite Flamingo

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.312675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.312675Z digest=sha256:dbdfb92f2934f4eda40d12106d0fcd71f84f32e44375c7a5dd56b6d12c879344

Observation bd089ad7-cb8e-41bc-844b-29e6d0413fef · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.327041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.327041Z digest=sha256:01322bf3a11a4a5eeb5ee2e416fd4578fb7379f38a6634b9ab0ad52a67471296

Observation c846a0c2-7942-4035-9215-f616b19fe0a9 · outbound

This paper cites GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.322175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.322175Z digest=sha256:0ba89e2a37e10ffad93e0b7922c05bd299fa5d7e13ef936c32d0719e9f1e50b7

Observation ab33ce5c-f8f6-4b53-a49d-96c561f8e8be · outbound

This paper cites A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.336510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.336510Z digest=sha256:d217281afd8551be127efe7994b47cbbed8a5d7172f6a5318722aa481a32d1ff

Observation b8276a3e-45ec-4053-afcf-cc6c492fa4e0 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.331481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.331481Z digest=sha256:5c1b0b55e192bee98ae382d1714abacd164a63e21c49a5060659ae729b66af86

Observation fc3de712-dac5-4d35-9584-7f13d4cbd7dc · outbound

This paper cites PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.346015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.346015Z digest=sha256:2e1968ad486fdf109ec9b60f6811e53bc73521665f2b2a27c2caa832f86b86ec

Observation c38a2aaa-97f6-430c-9b2e-740de6224856 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.341773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.341773Z digest=sha256:543a89d112282c377e9b8ae3c0ef580190dc17959167e4789d1b8da60e0dd375

Observation c902bd1b-f8df-4cc8-b0c7-e350b849d8d4 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.354807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.354807Z digest=sha256:d7e852e0a60eecafe2b9d16f781de9cbd80e664c836a25a6cb2b42eaeb1c4368

Observation f29064d1-35f5-4560-81fa-fbeecb340d41 · outbound

This paper cites An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.350120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.350120Z digest=sha256:0ab0fded36693d59cc1d223898b468b8e4df71825458b9185339390df0746b00

Observation 07018219-5482-4790-8ca2-1dce466a6770 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.369162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.369162Z digest=sha256:aba602975df01b8fdf948abf72c3cbf15cc7cc468e1dee2f46f95dc7405884dd

Observation 13f12c5e-a11f-4e44-a4cd-0edf5c0fda77 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.374638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.374638Z digest=sha256:15ceb46fa6599a9ba254d3229b11557be115df6b37c8964ec3d5ef29b7dbff85

Observation 509b8f1b-44d0-4033-88a3-3f49e6176625 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.364278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.364278Z digest=sha256:bb3e70cc12dcdf9daf93483e5bb9fa08e7ff06ba74b04f1dfef80798968f441f

Observation e7257bb8-252f-4140-81b7-0b8aad065ed7 · outbound

This paper cites InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.389504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.389504Z digest=sha256:f20e29b57a7c91e97558bccb15ba076d105975f9495f752c54382bf01bd7f27b

Observation 75fee6e8-3154-41aa-9617-1ab5e12fcb06 · outbound

This paper cites SOLO: A Single Transformer for Scalable Vision-Language Modeling.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey SOLO: A Single Transformer for Scalable Vision-Language Modeling

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.379180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.379180Z digest=sha256:933dbae925c0658523a93e7a14caf228b41898b4ccc13a107e6e8e4c9feff2dc

Observation cc0af5e5-0672-4f6d-9f7c-4119c6531bf5 · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Gonzalez, Ion Stoica, and Eric P

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.398122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.398122Z digest=sha256:eb3a95df984e3c434ad037c8d08e071928d5b132cdf85b49cc130c70aafb8bdb

Observation cd8c3b4d-786f-47fb-a49a-916c31af0e49 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.401875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.401875Z digest=sha256:0315903b984aa12caed7b23b2f2437f21e0159bcce57c72f78e9b6f5dc1dc687

Observation badb4c3c-3c3e-4faa-a453-53460556e332 · outbound

This paper cites Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.393986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.393986Z digest=sha256:2dfda4638bf4cb4f3e1b02a5179f19a21fe8656af181224425056cef5a6ebb8a

Observation 72a67477-9312-4982-9d53-88482032ab57 · outbound

This paper cites Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.409466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.409466Z digest=sha256:8afd9c3391b8091041643100c103070c147e6b70c98c6c37b84e830725d31c50

Observation afc1ca31-d0c4-4bb0-a47d-e4234d407cd6 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.413324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.413324Z digest=sha256:598e25666ed750ff239023b4d67b05353767b5eadd4cb626a087e9bd459fad22

Observation 82f325f2-ca7f-45ae-a15e-fc1f267be666 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.405469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.405469Z digest=sha256:2eaee4586df1a671996b7b0af553b2453e4b6129a1823b8f67ed250345f83ceb

Observation 53164fe2-376f-4cf1-bf58-52ad0b1476d4 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.422391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.422391Z digest=sha256:4ddb5e28e793bf7cb95500c95133225efb74d9b344e72e2c96e8a145799930ec

Observation deaa9bcf-89b0-4249-96e5-2573fc335e86 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.427039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.427039Z digest=sha256:75dd88ff4dde627e3b58e01b5aeac4e94a352aeb0f05e3c291ed803f3a8134ac

Observation 68ce523b-cb59-4d82-8f46-03f9ff65477d · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Training Verifiers to Solve Math Word Problems

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.417462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.417462Z digest=sha256:87156cb264c38f33b29cd9960dcb4bfb1939f03390776a3aae88b3fbf28cae3f

Observation 3c62bd7f-0bd4-493b-86e1-a4b6e785a9fb · outbound

This paper cites A Survey on Multimodal Large Language Models for Autonomous Driving.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey A Survey on Multimodal Large Language Models for Autonomous Driving

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.436221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.436221Z digest=sha256:7818f1131229d3e21cc31bd485b7cecf20e04e6c92b00d935e31f4f4f41c736a

Observation 2e138070-41d0-4e3f-bdc8-b36ac86a8f5a · outbound

This paper cites Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.441016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.441016Z digest=sha256:9cea78aecb1bfe7a9adc62bf40b1282522c733d0f1166d55f72fa689085dbfd9

Observation 53ade0a4-d6bb-4f8e-a636-6bac7e340233 · outbound

This paper cites Multi-Task Learning with Deep Neural Networks: A Survey.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Multi-Task Learning with Deep Neural Networks: A Survey

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.431584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.431584Z digest=sha256:390c05accf8308015032130ebedd1a92360cffa7b1881d80dcdad25b591ca549

Observation 8a2514d9-6259-4e23-8457-c78eed1d483a · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.450626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.450626Z digest=sha256:3adc48f819a07f7d1354d7347e87e6e0d8e7e904eab730dbb699ce4f23747239

Observation 0137b1e5-542f-4dbf-a1c7-5b910742c6b6 · outbound

This paper cites SpeechVerse: A Large-scale Generalizable Audio Language Model.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey SpeechVerse: A Large-scale Generalizable Audio Language Model

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.455567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.455567Z digest=sha256:03d20afcf31923b70615b73871550e874027227425b60abde661a86d479bc88d

Observation 00e51334-ec3f-4805-9bce-1ce34438fdb4 · outbound

This paper cites InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.445953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.445953Z digest=sha256:0b4e2c079d886b88f80df8c3788d4e57ff4f1795d5155986f94f28a684dca2de

Observation cf1f6e1d-f5f4-45a2-a2ad-888079543368 · outbound

This paper cites Heek, Matthias Minderer, Mathilde Caron, A.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Heek, Matthias Minderer, Mathilde Caron, A

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.470063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.470063Z digest=sha256:eb95f74438d93b940efb46e30a1b44e3bb29b8fc8d128395c7c2dc9a5a39247c

Observation 7f1a0eae-bc95-49e0-94b6-db766ed7b782 · outbound

This paper cites FMA: A Dataset For Music Analysis.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey FMA: A Dataset For Music Analysis

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.460484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.460484Z digest=sha256:21fbd7538c21ee064d77a1b5ea570a5576570fa1eded3bcc7b9d994b9d919e18

Observation fa457102-9ce3-46ca-8299-d1935f06b996 · outbound

This paper cites RedCaps: web-curated image-text data created by the people, for the people.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey RedCaps: web-curated image-text data created by the people, for the people

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.484638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.484638Z digest=sha256:c8a18454c1cee199ba808e3bc2d2c493a4f349ce09bf2c29f87a9505e8477443

Observation a55c6631-90df-4e81-a2a6-0f00f8b09eba · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.488476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.488476Z digest=sha256:1f0c48eb6cae0b347d48f15825ff2d5e26e8f9eba40ab7f80807a0bb624900f5

Observation 765fec69-3ccf-437c-8bda-76cccfd07904 · outbound

This paper cites Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.475206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.475206Z digest=sha256:9874fa5ef97459db1719ebcf049d10ab125118bf4546a9a9d128ff5112f8af5c

Observation 1fc8a169-2507-4ff8-bdd8-d04f010a0bef · outbound

This paper cites Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.480020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.480020Z digest=sha256:a649765851b4e0c4cc0123cea481de63ba65c4617a478d3f98799021c7176705

Observation 633b3996-342d-4b91-a586-7ff45ee4dde0 · outbound

This paper cites Jukebox: A Generative Model for Music.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Jukebox: A Generative Model for Music

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.500382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.500382Z digest=sha256:3a9776d1f45dc973df02213bad5a8a1568b43c92b405f8beea255e1e1a0b8f7b

Observation 8b092bff-42bc-475a-83b8-3cde6722c081 · outbound

This paper cites Diffusion Models Beat GANs on Image Synthesis.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Diffusion Models Beat GANs on Image Synthesis

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.504454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.504454Z digest=sha256:9c82802b7edad07bef35e844e0825aa121e251681ba5f4b52ef47e7b0a25186b

Observation 9f9ae898-7e3e-4421-b8b5-47f009d353fc · outbound

This paper cites ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.492409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.492409Z digest=sha256:58b49668d596ee82c9b8dfd7361139433787857e38ef17120dbbbc6a1a9e2ca8

Observation 0db26017-e73b-4b5a-bbd4-f65a0efcc41d · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.496489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.496489Z digest=sha256:a355018164a9f6c701debc3b96255f33a0106bbe1f46a490de8ff897b7b351fe

Observation 30957332-f18c-47c2-8655-5cd706c375cb · outbound

This paper cites Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.518521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.518521Z digest=sha256:e05ae01a75b69d57ed205b9d21ddce745436cfc51b9de7c12684bfa85d03a3d5

Observation 9348cce5-7787-4b82-a51d-f789edf73607 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.523561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.523561Z digest=sha256:c68dc1dba9587a349dad6ad11d289a5212358267259f9821b2c62df696986884

Observation 45336d13-7523-4ecb-a115-66b85f1dd4c4 · outbound

This paper cites Unveiling Encoder-Free Vision-Language Models.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unveiling Encoder-Free Vision-Language Models

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.509004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.509004Z digest=sha256:5a494a26ea394fc56febd57302f4571b6ae30e20fdbfa121638a354dc55cf625

Observation 363f135a-4496-4ee9-8fe1-47b4341fa4e6 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.513974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.513974Z digest=sha256:a9c082af802aeba7ab6c03a171aea97eab7ab74921657784cee9de63ada59199

Observation 3426ff5a-082f-44e3-a0a9-3a0b7ff33c0e · outbound

This paper cites LP-MusicCaps: LLM-Based Pseudo Music Captioning.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey LP-MusicCaps: LLM-Based Pseudo Music Captioning

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.537265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.537265Z digest=sha256:94c8b5cdb42690c1444c22cdd46384f13ded5a72536208b43d31ed800ed6ff2a

Observation 5d98913d-cb37-4594-b764-ac87293184d3 · outbound

This paper cites A Survey on In-context Learning.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey A Survey on In-context Learning

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.542017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.542017Z digest=sha256:3d585bd72036b83e12317973f9110b37bed3b484b46d4e56ec0066aedade7d48

Observation 7077c327-7bbb-428a-af1d-e3db90907591 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.528111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.528111Z digest=sha256:21ba8736d96960fec73378537d95c61a8b4f9ae8db72ad4c38dde6c9d0ba3ee9

Observation 13641ca5-614b-440a-8b41-d66e6fd25f4b · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.532673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.532673Z digest=sha256:d05a0bfe85d91d90597083ede39a25fc7182cbb38a68e3c8c2f2bc41e81439d1

Observation f9d7d0b9-eec7-4b4c-93b5-4edc22129e86 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey PaLM-E: An Embodied Multimodal Language Model

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.556420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.556420Z digest=sha256:dd450ef409df20a1889e6b91d8561ccd858087d5f76289a020a80a826341e249

Observation 469ec685-3bfb-4f72-8275-502b27fef095 · outbound

This paper cites an unresolved cited work.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey Unresolved cited work

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.561434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.561434Z digest=sha256:88339b03682a9fd302623fd2a16b5013399e8c2222da4b7ad8451c310a820291

Observation b820cdd7-daab-4380-885b-ae0376eb4fff · outbound

This paper cites DreamLLM: Synergistic Multimodal Comprehension and Creation.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey DreamLLM: Synergistic Multimodal Comprehension and Creation

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.546678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.546678Z digest=sha256:226fc6faf3e027f70a5776d054bd3e60129977d4b6ed0c72154a47bdf439267e

Observation 0e19db84-16ba-4bf2-81e9-d598746136d2 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.551495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.551495Z digest=sha256:eb36c82c84b6b74944bcbf6e05101410d7de1ae7eb9cd8ac0bcee00e98ebbd63

Observation d945b4da-fc3e-4a39-b2fb-33fc5d52be69 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.576272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.576272Z digest=sha256:e308ef9586f38fc89a11e7dd3fc54b2a01836dad240c46d239fd3ba55680d1e9

Observation 5a9409a4-187f-48ff-9a6d-3cffe028e505 · outbound

This paper cites LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT.

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT

Reference 102

Resolution
unresolved
no resolver link, observed 2026-08-11T14:59:01.581000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:59:01.581000Z digest=sha256:0e43ce12c8916fdcbf96c67f8c0f623282c07848cd2d11f0991779c23055b5e6

Pith citing papers

Observation c3c21c6f-1c09-4d2c-b84d-216470d0d4f6 · inbound

Parallelized Autoregressive Visual Generation cites this paper.

Parallelized Autoregressive Visual Generation Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T11:42:31.574249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:42:31.574249Z digest=sha256:db4b0a6d414eae431da1ee4ae726c4e18e8910274e9a9920726044e85b54767f

Observation f71d18ae-288c-4b3e-b5ec-688d1f8a70a4 · inbound

Visual Autoregressive Modeling for Image Super-Resolution cites this paper.

Visual Autoregressive Modeling for Image Super-Resolution Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T21:47:59.515837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T21:47:59.515837Z digest=sha256:3426855bb67a6a6769506bbd984f30b5cb3e3fbd1094d96dd0860dfc10c08e1b

Observation 22a69b2b-05a7-40c0-8e36-ad046e9930c2 · inbound

Next Block Prediction: Video Generation via Semi-Autoregressive Modeling cites this paper.

Next Block Prediction: Video Generation via Semi-Autoregressive Modeling Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-08T11:51:13.184615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:51:13.184615Z digest=sha256:6869488cd2d6a1937a754708c8629f1e641e689163ff1249ef6880ef14d92157

Observation 585b2bba-ca37-4592-acf3-41a4270dc873 · inbound

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation cites this paper.

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-15T16:24:27.465541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-15T16:24:27.407376Z digest=sha256:e4cd1f7134a629ec0f9c734e71bf5b5e8609f6c7ad75804a28ca1b976dab56eb

Observation 2688273f-f0cc-40ae-ba27-e79b85be1831 · inbound

On The Landscape of Spoken Language Models: A Comprehensive Survey cites this paper.

On The Landscape of Spoken Language Models: A Comprehensive Survey Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-22T20:45:08.044990Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T20:44:57.476464Z digest=sha256:c6ea227cdd24b42d1512245ee0f8bde1346f763701b74941939d3f5b2eeebc04

Observation 63f2893d-8961-4a1b-8a61-e8cfd3cbb1e0 · inbound

Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning cites this paper.

Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:38:27.366464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:38:27.366464Z digest=sha256:e737b21ed84f21296e3cdab1df82b5229a412c3c7793417a9b0875994c36c16f

Observation ca3c074a-5b51-4347-af22-492564f5c003 · inbound

Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing cites this paper.

Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:27:58.571076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:27:58.571076Z digest=sha256:40b760b172afa9dd4045b8bbd0f829bf9e8f4046fe1e3c708e0d76f50c31021d

Observation 18e7c4a7-cc8a-4549-9bf3-db27cfb420f7 · inbound

MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports cites this paper.

MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T23:10:44.228630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:10:44.228630Z digest=sha256:e16c1aec8bf78ae3574fa3362a507c7d1e6f4ebea13a28f183b869215cea92dc

Observation 33a4a4e7-6b4a-4391-8c41-85d13f924c68 · inbound

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation cites this paper.

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T21:55:45.970164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:55:45.970164Z digest=sha256:1fd7f10979cf2f56743b0b40a0b83cc3cda83423b5c0308b3f3b2c9e89b119be

Observation 8eabab2d-0baa-405b-8d9a-8a88ffcd9422 · inbound

A Unified Low-level Foundation Model for Enhancing Pathology Image Quality cites this paper.

A Unified Low-level Foundation Model for Enhancing Pathology Image Quality Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T13:00:48.147977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:00:48.147977Z digest=sha256:bae0322243a014590e104fa266ef1e4bff010410791379d1017134e3503a73ed

Observation b0e0be72-5092-499a-9868-616165665746 · inbound

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization cites this paper.

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:16:28.852066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-12T03:33:45.192139Z digest=sha256:550d501b2bfa31de78947dd70aaf17cdbbd4ebda8766e5fce5e0fb432e6e3691

Observation 9e0d91d4-6eb3-4809-be35-12fa1b4a0948 · inbound

NITP: Next Implicit Token Prediction for LLM Pre-training cites this paper.

NITP: Next Implicit Token Prediction for LLM Pre-training Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-06-30T12:24:39.261088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-06-30T12:23:42.587689Z digest=sha256:d77a0119ab0cffcaed3d8c7155a96dd7459752a957850b656e6fe06ab92546d9

Observation a72629b2-ab5b-4326-9104-a826e9231761 · inbound

NITP: Next Implicit Token Prediction for LLM Pre-training cites this paper.

NITP: Next Implicit Token Prediction for LLM Pre-training Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:39:16.236947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-07-04T00:38:33.708836Z digest=sha256:6b0dae3f5007622498b4db3c516b4ca8264527be9d4ddbcb0518b71576a7bf34

Observation 1c3ab298-d7ac-4ac3-b52e-158f88d19a75 · inbound

NITP: Next Implicit Token Prediction for LLM Pre-training cites this paper.

NITP: Next Implicit Token Prediction for LLM Pre-training Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-14T18:45:28.635910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T18:45:28.635910Z digest=sha256:e743fb6a64212714efb6258d3ae98fe3865f3d003fd521d9adaed97de62e3e4f

Observation 9765716f-0b0e-46d2-85c9-50c56f27fb6f · inbound

Toward Native Multimodal Modeling: A Roadmap cites this paper.

Toward Native Multimodal Modeling: A Roadmap Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 224

Resolution
verified exact
arxiv_id, observed 2026-06-29T23:04:02.082867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-29T22:58:38.610609Z digest=sha256:92aff31071d5c2eeeb42740c1af481cfb2b3ead690f635da5fdaba5ab86716a6

Observation 7d2e77ea-d6c9-45b9-921d-c920dc26abb9 · inbound

PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images cites this paper.

PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-01T22:06:15.887435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-28T15:50:54.950899Z digest=sha256:60cb8e8c65ac8d3796d2e7b0b381b1492fe102783f71f01369a91f14f504ae23

Observation 91cf0468-9629-4d60-b85b-94d377b9ac20 · inbound

PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience cites this paper.

PseudoBench: Measuring How Agentic Auto-Research Fuels Pseudoscience Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-07-03T20:18:56.449179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-06-27T01:29:12.725865Z digest=sha256:43b69abde3855d35be5662fa3345d07b774263db82920ef0987b0956d703cced