Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-01T01:07:44.700601Z
Paper Citation Record · LEDGER
As of 6 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2607.25948.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-01T01:07:44.700601Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
71 of 71 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation b7af4607-798a-4f1a-a433-761485bddcb2 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Onestory: Coherent multi-shot video generation with adaptive memory
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e7da88ea-7b05-4343-bf8c-161a3853c390 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fdb69622-c75c-475e-9456-fb61c02c6594 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities F., Mizrahi, D., Garjani, A., Gao, M., Griffiths, D., Hu, J., Dehghan, A., and Zamir, A
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a449c5c-e315-458b-ba95-8405a411baad · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities F., Amirloo, E., El-Nouby, A., Zamir, A., and Dehghan, A
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d78549ec-17c0-440f-b1b1-5a9dcc1d261e · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Qwen technical report
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a9dcbb7d-5890-435a-a94f-0d1725df9d7a · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Unresolved cited work
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 46c8f8a8-a81a-4992-a0e0-2dccdd5ec62d · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Unresolved cited work
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 57604e31-2c51-4fbb-8dab-01200429c1fd · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b869179f-21cf-46ff-9b69-f8984b1ca880 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Hunyuanimage 3.0 technical report
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fd71cd17-de0f-481a-980b-a7686a66ae88 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 57bf5138-9d70-4549-90b1-e5aa2eeebae5 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Janus-pro: Unified multimodal understanding and generation with data and model scaling
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 97cc8852-456d-46ec-aa5e-f57a33517fb1 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a9538d68-2aab-468a-bb71-cd26887243eb · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Tts-var: A test-time scaling framework for visual auto-regressive generation
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 484600dc-4e55-429e-b872-7efc03643c56 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Emerging Properties in Unified Multimodal Pretraining
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 044a9e8a-552b-4fad-bc18-b6031c72659d · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Scaling rectified flow transformers for high-resolution image synthesis
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c381132-8b6d-4d64-8131-8c96a11d9f61 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Eva-02: A visual representation for neon genesis
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 92f30247-3fd9-45c7-85b0-32791109a20a · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4f3cf5b0-126f-4f7e-94ec-eda2d793df96 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Image Generators are Generalist Vision Learners
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ea97de85-c3c5-4b00-ae5c-ee1c4d4a60ea · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities (1D) Ordered Tokens Enable Efficient Test-Time Search
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation caa1b8b8-fe2f-4f42-b983-4e16982c3614 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities V., Joulin, A., and Misra, I
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a946ee6-ce03-45a4-82a9-e233a074d4d6 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities A., Hu, V
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ac2acb9a-f852-4aa6-aa30-1db3ad0e1c23 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e5c93c0c-38a5-4019-9c8a-35288b16bff7 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Infgen: A resolution-agnostic paradigm for scalable image synthesis
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1ab17dc3-94ce-4fac-aa6e-824330cb07eb · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Lotus: Diffusion-based visual foundation model for high-quality dense prediction
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8917cfc2-05c4-44a9-abfb-18fdbb7f99b6 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 11d2c4f3-34ec-4af4-98bf-a12c513862d1 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities F., Yeo, T., Atanov, A., and Zamir, A
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e63f2dc1-38e4-4f6c-b67c-4f3af3d3374c · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities C., and Schindler, K
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e7ff95fa-c581-4ef3-9356-3e37dbab68d8 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Marigold: Affordable adaptation of diffusion-based image generators for image analysis
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 44986c82-afe9-488e-9028-bbbc567b9340 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities C., Lo, W.-Y., Doll\'ar, P., and Girshick, R
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ce79e231-ea6a-453d-806b-d42d9c932483 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities H., Pham, T., Lee, S., Clark, C., Kembhavi, A., Mandt, S., Krishna, R., and Lu, J
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 979015d4-c47f-4f5e-b32a-066f1f02aec0 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Llava-onevision: Easy visual task transfer
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cc3256f6-9602-497b-9d6b-2310fe33d191 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Human Motion Instruction Tuning
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1bb69985-5ba9-4f44-9e9f-2f72bfe34b86 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Multiple human motion understanding
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f6112e8d-96e3-4ab2-912d-0c6945fc47b6 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Exploring plain vision transformer backbones for object detection
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ea61d52-01cf-4487-8107-678ab0f43331 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 95db9159-1b90-4bf7-aff2-269d09e674bc · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities T., Ben-Hamu, H., Nickel, M., and Le, M
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 060d3eb6-92ab-4c06-8d76-2fa62e8d3cf3 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Unresolved cited work
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a8d033a5-548d-4048-8bc9-3b95b10626ff · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Grounding dino: Marrying dino with grounded pre-training for open-set object detection
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 34e7b16e-aca6-4f35-9f56-7d7be3dce7a3 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities S., Yang, S., Wang, Y., Yang, J., and Cheng, M.-M
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8dd8132b-de87-422f-b50e-ab66fdc5afb5 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Unified-io: A unified model for vision, language, and multi-modal tasks
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 469f901b-2d17-4e46-beeb-9986f0ad6037 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cc13e216-2ea0-4b37-9789-03efe6ccf0b1 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eb873ab9-d4f1-4d5f-a445-405f0ad7e565 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c1533c3a-54da-4978-9379-c5a0999bf124 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities 4m: Massively multimodal masked modeling
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9647dec3-8c43-4dfe-acd5-58ce86a33b38 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities C., Scalia, G., and Eraslan, G
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bee50578-0606-4328-b77e-05eb79acfaf9 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Dinov2: Learning robust visual features without supervision
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0794a551-45f8-4606-a1f8-af2919677e0f · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Aion-1: Omnimodal foundation model for astronomical sciences
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c9bbe1af-7a38-48ce-8694-0d21755a7e3a · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Kosmos-2: Grounding multimodal large language models to the world
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c4b25431-7559-4683-93e9-3f3402e1d031 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e20b6ef7-64f0-4595-bb30-89d2b3923bdc · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities F., and Zamir, A
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b1647729-333d-4f06-a5b1-be01b9d3a2d3 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities M., Xing, E., Yang, M.-H., and Khan, F
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 880ba2f5-b222-4e83-acf9-aee1a6cc14e7 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Grounded sam: Assembling open-world models for diverse visual tasks
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1478dea4-1425-4e93-88d6-705cc436ecc5 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Prom3e: Probabilistic masked multimodal embedding model for ecology
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ac39a35a-4a55-422e-9216-ad3a863fd25e · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities A General Framework for Inference-time Scaling and Steering of Diffusion Models
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d7e7bd2-ad2d-4f4a-b135-a3568746643b · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9195b562-99db-4c78-a94f-fed84208ecac · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9698ebde-4dc9-42dd-ba28-bea7d9a92224 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Chameleon: Mixed-modal early-fusion foundation models
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6ca3e55d-0779-448e-8486-4fe10a976446 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities M., Hauth, A., Millican, K., et al
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 29e518d6-f0d9-4c7c-bee8-09f1be1f2fc1 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Visual autoregressive modeling: Scalable image generation via next-scale prediction
Reference 59
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fde2313f-77c4-4f3f-a550-f60b3721a6b9 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Llama 2: Open foundation and fine-tuned chat models
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2657e103-86f4-42af-aa21-92b1bed1d70d · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8de3e3dd-05d3-426c-8048-2cad7032dd68 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Emu3: Next-token prediction is all you need
Reference 62
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 26baf85d-08aa-4ae1-b2c4-84a14ef23af2 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Janus: Decoupling visual encoding for unified multimodal understanding and generation
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 923d5874-0203-4783-b7c6-ec6fb541cb08 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Next-gpt: Any-to-any multimodal llm
Reference 64
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0057a862-fe17-4014-aa9f-b6fbc922aaa5 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1249a70b-02c1-44e4-89a5-113a54cdf00d · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities J., Wang, W., Lin, K
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a8e2b309-34a5-40cc-aa63-50de98138b5f · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Depth anything v2
Reference 67
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c7270472-a27a-40fc-88d8-d1abc4abd4b7 · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Anygpt: Unified multimodal llm with discrete sequence modeling
Reference 68
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 26cba2ae-6af0-431b-b1f6-cf3c4e82515b · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Inference-time scaling of diffusion models through classical search
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e75de20-d6fc-47f2-86bc-d4b90408546b · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Reference 70
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6d48867f-a489-449a-9428-abae43d5dd2e · outbound
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Minigpt-4: Enhancing vision-language understanding with advanced large language models
Reference 71
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.