Pith. sign in

hub Canonical reference

Beyond language modeling: An exploration of multimodal pretraining

Canonical reference. 100% of citing Pith papers cite this work as background.

15 Pith papers citing it
Background 100% of classified citations

hub tools

citation-role summary

background 5

citation-polarity summary

years

2026 15

roles

background 5

polarities

background 5

representative citing papers

Rosetta: Composable Native Multimodal Pretraining

cs.CV · 2026-07-01 · unverdicted · novelty 5.0

Rosetta proposes a composable multimodal pretraining method with MAOP to prevent catastrophic forgetting when expanding modalities beyond standard MoE and MoT approaches.

VGGT-$\Omega$

cs.CV · 2026-05-14 · unverdicted · novelty 5.0

VGGT-Ω improves feed-forward reconstruction accuracy and efficiency by architectural simplifications, register-based attention, and training on much larger supervised and unlabeled video data.

Toward Native Multimodal Modeling: A Roadmap

cs.CV · 2026-05-25 · unverdicted · novelty 3.0

A roadmap that defines architectural nativity for multimodal models and categorizes them into Multi-to-Text, Multi-to-Target, and Multi-to-Multi types while outlining an industrial pipeline toward unified transformer-based native multimodal modeling.

citing papers explorer

Showing 15 of 15 citing papers.