{"as_of":"2026-08-06T12:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1cea2d18dedbbce220911a387a71fcce3a6f3f821d2aec19f2889621106796d","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:07:44.700601Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25948/citation-record","integrity":"/paper/2607.25948/integrity","json":"/paper/2607.25948/citation-record.json","paper":"/paper/2607.25948"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:42.837630Z","title":"Onestory: Coherent multi-shot video generation with adaptive memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:42.837630Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:f4334fb606716f2051b37e66bf19cfc8669a209d71fbf52b106ab313eee02fe4","observation_id":"b7af4607-798a-4f1a-a433-761485bddcb2","resolution":{"observed_at":"2026-08-01T01:07:42.837630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.26599","last_updated":"2026-07-11T20:08:28Z","snapshot_observed_at":"2026-08-06T02:17:15.078741Z","submitted_at":"2026-03-27T16:57:51Z","title":"VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.26599","snapshot_observed_at":"2026-08-01T01:07:42.950617Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:42.950617Z"},"links":{"cited_paper":"/paper/2603.26599","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:c82b4b9413a1e30c9a7f944b1c8709733cd6b1ef6a90479acd6da8e25138d7e5","observation_id":"e7da88ea-7b05-4343-bf8c-161a3853c390","resolution":{"observed_at":"2026-08-01T01:07:42.950617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:42.990734Z","title":"F., Mizrahi, D., Garjani, A., Gao, M., Griffiths, D., Hu, J., Dehghan, A., and Zamir, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:42.990734Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:2a067f6da81c97dbea6303296b7bdd25145562cf41404a989e06ff69a32e3873","observation_id":"fdb69622-c75c-475e-9456-fb61c02c6594","resolution":{"observed_at":"2026-08-01T01:07:42.990734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.070887Z","title":"F., Amirloo, E., El-Nouby, A., Zamir, A., and Dehghan, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.070887Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:b00c705d292c96a1fcb2b7f16f490b9db6dbf5f5084be0523339de1556f76b7d","observation_id":"9a449c5c-e315-458b-ba95-8405a411baad","resolution":{"observed_at":"2026-08-01T01:07:43.070887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.123780Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.123780Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:dc9c8ab84ad610954a9429a35a23e57ccc01f56053b75c0960c5c46e66c379e9","observation_id":"d78549ec-17c0-440f-b1b1-5a9dcc1d261e","resolution":{"observed_at":"2026-08-01T01:07:43.123780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.193803Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.193803Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:e3ed7b6c573ca7dee20c923feaec26f96c67653f2c600e5b8377809d59eabca1","observation_id":"a9dcbb7d-5890-435a-a94f-0d1725df9d7a","resolution":{"observed_at":"2026-08-01T01:07:43.193803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.298142Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.298142Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:9f24b34ba1e2ff0b807727fc8a487841889c163c29e49d7452163a38667569ab","observation_id":"46c8f8a8-a81a-4992-a0e0-2dccdd5ec62d","resolution":{"observed_at":"2026-08-01T01:07:43.298142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-01T01:07:43.421541Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.421541Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:69c36b5fbcd38d131a1450de07289162dc1176e38bb1ae2fc239d5650664ca7b","observation_id":"57604e31-2c51-4fbb-8dab-01200429c1fd","resolution":{"observed_at":"2026-08-01T01:07:43.421541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.569475Z","title":"Hunyuanimage 3.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.569475Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d93cd0ee5aacb494234339abf17c2ccca9d3456d2acdfb3ad1fa2fe8cae4c07a","observation_id":"b869179f-21cf-46ff-9b69-f8984b1ca880","resolution":{"observed_at":"2026-08-01T01:07:43.569475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.710523Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.710523Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:ac87ace25ef5769d3244ceac8c5174d7dc5987779c823738ba23d7771aba792d","observation_id":"fd71cd17-de0f-481a-980b-a7686a66ae88","resolution":{"observed_at":"2026-08-01T01:07:43.710523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.805619Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.805619Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:3f3b69d28102dad93391a8c7e49ec588d6d5295057c3e97eea4f25a7dd262c2a","observation_id":"57bf5138-9d70-4549-90b1-e5aa2eeebae5","resolution":{"observed_at":"2026-08-01T01:07:43.805619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:43.940046Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:43.940046Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:94708177e54bc72bd9ef31e4c21bce8482a3ba6b8e195f7829e21596f4a8c69f","observation_id":"97cc8852-456d-46ec-aa5e-f57a33517fb1","resolution":{"observed_at":"2026-08-01T01:07:43.940046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.029530Z","title":"Tts-var: A test-time scaling framework for visual auto-regressive generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.029530Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:1a164039199a4cc684d0ccb23924854b5603b25097ffdd2eb8b71df40211d967","observation_id":"a9538d68-2aab-468a-bb71-cd26887243eb","resolution":{"observed_at":"2026-08-01T01:07:44.029530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-01T01:07:44.183367Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.183367Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:9b2357e48314e0d31d24f2dd1217fa7bee90161818acc2734894569322ed1514","observation_id":"484600dc-4e55-429e-b872-7efc03643c56","resolution":{"observed_at":"2026-08-01T01:07:44.183367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.293487Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.293487Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:aad6b1529238bc9945147de5b0c2dc0a24687ba072308ade70ebbe9b449e6f2f","observation_id":"044a9e8a-552b-4fad-bc18-b6031c72659d","resolution":{"observed_at":"2026-08-01T01:07:44.293487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.439838Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.439838Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d0a0672107a243deace0be17b727fabc901d772085f710faf4f697f11bc74485","observation_id":"0c381132-8b6d-4d64-8131-8c96a11d9f61","resolution":{"observed_at":"2026-08-01T01:07:44.439838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.546079Z","title":"Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.546079Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d5a83d4e55f629429d07ddd303e105495c2eed2ef1dec80a910124b7d277b5d0","observation_id":"92f30247-3fd9-45c7-85b0-32791109a20a","resolution":{"observed_at":"2026-08-01T01:07:44.546079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20329","snapshot_observed_at":"2026-08-01T01:07:44.549021Z","title":"T., Genova, K., Kannen, N., Ben, S., Li, Y., Guo, M., and Yogin, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.549021Z"},"links":{"cited_paper":"/paper/2604.20329","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:92b30aadd51423bb955ce3608a0adfcee7b90bedde7d5606c170b73ef880db31","observation_id":"4f3cf5b0-126f-4f7e-94ec-eda2d793df96","resolution":{"observed_at":"2026-08-01T01:07:44.549021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15453","last_updated":"2026-04-16T18:13:48Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T18:13:48Z","title":"(1D) Ordered Tokens Enable Efficient Test-Time Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15453","snapshot_observed_at":"2026-08-01T01:07:44.552269Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.552269Z"},"links":{"cited_paper":"/paper/2604.15453","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:b20eca60c55cff9b69aba5c8120b3f931c69b4cf23775f1e362fd528e0030d42","observation_id":"ea97de85-c3c5-4b00-ae5c-ee1c4d4a60ea","resolution":{"observed_at":"2026-08-01T01:07:44.552269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.555149Z","title":"V., Joulin, A., and Misra, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.555149Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:c062098b166db846a09cb3cde5e9869c883b8b10907605780c46967fc4243591","observation_id":"caa1b8b8-fe2f-4f42-b983-4e16982c3614","resolution":{"observed_at":"2026-08-01T01:07:44.555149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.557763Z","title":"A., Hu, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.557763Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:7f4b95e79391c6d5d0b418e3ac741d4ae8c7bd0ce756aa72c381e412894b7b7a","observation_id":"8a946ee6-ce03-45a4-82a9-e233a074d4d6","resolution":{"observed_at":"2026-08-01T01:07:44.557763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.560922Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.560922Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:aa47127d5f372eaf65e84322a541bc841afaaea8fc813df705abcb6b65cd747f","observation_id":"ac2acb9a-f852-4aa6-aa30-1db3ad0e1c23","resolution":{"observed_at":"2026-08-01T01:07:44.560922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.563832Z","title":"Infgen: A resolution-agnostic paradigm for scalable image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.563832Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:79267c86b422ffda6fb16616bdc1ee3380fc410a1a702fcaf2ed96ccbfd3b62b","observation_id":"e5c93c0c-38a5-4019-9c8a-35288b16bff7","resolution":{"observed_at":"2026-08-01T01:07:44.563832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.566412Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.566412Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:130907b9f4158a0729b2efd4c935381d6d7e95dd9af2e6db72d86a92a130894a","observation_id":"1ab17dc3-94ce-4fac-aa6e-824330cb07eb","resolution":{"observed_at":"2026-08-01T01:07:44.566412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.569312Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.569312Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:13be287eae122f315cfaedb1362d559b112fcb1bcca7ee15f699ee72ada91dbb","observation_id":"8917cfc2-05c4-44a9-abfb-18fdbb7f99b6","resolution":{"observed_at":"2026-08-01T01:07:44.569312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.571952Z","title":"F., Yeo, T., Atanov, A., and Zamir, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.571952Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:3cf8ce59d467777575edfe4f8ad96913ba6a59d2f62b5db1d34f821c2284f167","observation_id":"11d2c4f3-34ec-4af4-98bf-a12c513862d1","resolution":{"observed_at":"2026-08-01T01:07:44.571952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.574636Z","title":"C., and Schindler, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.574636Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:2f7d5c90e41c86d5ebf25009fad29f098be7a4e037dd36a73cfd99c0073521e8","observation_id":"e63f2dc1-38e4-4f6c-b67c-4f3af3d3374c","resolution":{"observed_at":"2026-08-01T01:07:44.574636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.577470Z","title":"Marigold: Affordable adaptation of diffusion-based image generators for image analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.577470Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:3d811231945dff5433ceec66addeb78220958d11ab5310a8785772d90ee41107","observation_id":"e7ff95fa-c581-4ef3-9356-3e37dbab68d8","resolution":{"observed_at":"2026-08-01T01:07:44.577470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.580767Z","title":"C., Lo, W.-Y., Doll\\'ar, P., and Girshick, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.580767Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:1597dc1a47385e284edca2b6c09c2bd158641ae64a23e0aabba52181d5b21b59","observation_id":"44986c82-afe9-488e-9028-bbbc567b9340","resolution":{"observed_at":"2026-08-01T01:07:44.580767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.584083Z","title":"H., Pham, T., Lee, S., Clark, C., Kembhavi, A., Mandt, S., Krishna, R., and Lu, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.584083Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:741d455a81f630bf00c7881393db2078fe29abeddf420406e1c4907aa7eafaad","observation_id":"ce79e231-ea6a-453d-806b-d42d9c932483","resolution":{"observed_at":"2026-08-01T01:07:44.584083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.586778Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.586778Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:efa9b1b6b9b82b339e8d2f6b245083076bb0de634fef6b9c3aab3b47b4e7261e","observation_id":"979015d4-c47f-4f5e-b32a-066f1f02aec0","resolution":{"observed_at":"2026-08-01T01:07:44.586778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.589373Z","title":"Human Motion Instruction Tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.589373Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:2fbe3a3e86e9f46782941243d2a6ee134ab6753ac77c24fce5eb10dd58b37ad5","observation_id":"cc3256f6-9602-497b-9d6b-2310fe33d191","resolution":{"observed_at":"2026-08-01T01:07:44.589373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.592156Z","title":"Multiple human motion understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.592156Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d2fc2c78a8f2113822013b20dbf12113536333c9a0da976d236fae6c77da0983","observation_id":"1bb69985-5ba9-4f44-9e9f-2f72bfe34b86","resolution":{"observed_at":"2026-08-01T01:07:44.592156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.595148Z","title":"Exploring plain vision transformer backbones for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.595148Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:632fada824c06d27eaddcb70d19ebba88a7bf5f96525e2530745f295a5b410ef","observation_id":"f6112e8d-96e3-4ab2-912d-0c6945fc47b6","resolution":{"observed_at":"2026-08-01T01:07:44.595148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.597954Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.597954Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:f2c3c95dc46110aaa5834e212c843c735562c85100efa008e22e37446aa378e9","observation_id":"0ea61d52-01cf-4487-8107-678ab0f43331","resolution":{"observed_at":"2026-08-01T01:07:44.597954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.600593Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.600593Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:4846244e2c2952c527003aa0852b9ac3f9da741f37e7f5ad62d750bfe64b4a29","observation_id":"95db9159-1b90-4bf7-aff2-269d09e674bc","resolution":{"observed_at":"2026-08-01T01:07:44.600593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.603534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.603534Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:40236992d5e483e6ad7290c94da0e547d0cb9d890677001b86b86a279f28e5c0","observation_id":"060d3eb6-92ab-4c06-8d76-2fa62e8d3cf3","resolution":{"observed_at":"2026-08-01T01:07:44.603534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.605996Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.605996Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:20a726669ec2abef5188170f9da678d682b4cdb0eb0c93a5b2862fd1a48b06cb","observation_id":"a8d033a5-548d-4048-8bc9-3b95b10626ff","resolution":{"observed_at":"2026-08-01T01:07:44.605996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.608739Z","title":"S., Yang, S., Wang, Y., Yang, J., and Cheng, M.-M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.608739Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:7291b2bcec35129d185677d7f980d0e0d19d79cf0a07f8b5718a5ea95e3c858e","observation_id":"34e7b16e-aca6-4f35-9f56-7d7be3dce7a3","resolution":{"observed_at":"2026-08-01T01:07:44.608739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.611365Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.611365Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:c0e87f0ca3296eb8c13c25f2c23b47608d1137abbb559e2fa64012bafcea686c","observation_id":"8dd8132b-de87-422f-b50e-ab66fdc5afb5","resolution":{"observed_at":"2026-08-01T01:07:44.611365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.614565Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.614565Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:49239571cacd7cf997128bf8646b560335de1618d09e725e202f783460815078","observation_id":"469f901b-2d17-4e46-beeb-9986f0ad6037","resolution":{"observed_at":"2026-08-01T01:07:44.614565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-01T01:07:44.617136Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.617136Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:fa054667e42933f5a41966f36e8f8f4a9bafaaebfc43bda48c4b507d7a837f8c","observation_id":"cc13e216-2ea0-4b37-9789-03efe6ccf0b1","resolution":{"observed_at":"2026-08-01T01:07:44.617136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.620666Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.620666Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d9b3ac13bf69cf91cdb3463dd64e42a521788ffea80dee1793404f1e967543ed","observation_id":"eb873ab9-d4f1-4d5f-a445-405f0ad7e565","resolution":{"observed_at":"2026-08-01T01:07:44.620666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.623368Z","title":"4m: Massively multimodal masked modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.623368Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:f0f65a904bc592b041b947ca084d0831fea0fed82384151666dbdbfc0784098c","observation_id":"c1533c3a-54da-4978-9379-c5a0999bf124","resolution":{"observed_at":"2026-08-01T01:07:44.623368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.626025Z","title":"C., Scalia, G., and Eraslan, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.626025Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:af49e550880bb1860e91881814bee648fe2a680e5d422c5129c5119084ec568f","observation_id":"9647dec3-8c43-4dfe-acd5-58ce86a33b38","resolution":{"observed_at":"2026-08-01T01:07:44.626025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.629111Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.629111Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:7fb21331a5d41658cd7f8861fff7ebacea8bdc678e8f270e91179abf0d314026","observation_id":"bee50578-0606-4328-b77e-05eb79acfaf9","resolution":{"observed_at":"2026-08-01T01:07:44.629111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.631670Z","title":"Aion-1: Omnimodal foundation model for astronomical sciences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.631670Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:b3d26ae2c8e2831666c2a179168169d5dac761c1d6e3ce6135571d60ee6cd4ab","observation_id":"0794a551-45f8-4606-a1f8-af2919677e0f","resolution":{"observed_at":"2026-08-01T01:07:44.631670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.634306Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.634306Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:6299de37425f73b6d869d813b13385444af47fdee08b68fc9f98f8f5e3680d99","observation_id":"c9bbe1af-7a38-48ce-8694-0d21755a7e3a","resolution":{"observed_at":"2026-08-01T01:07:44.634306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.637103Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.637103Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:bd2d372350faf21fbd852b750b352fa7a5e0d766cd2320ee153bf348c298084a","observation_id":"c4b25431-7559-4683-93e9-3f3402e1d031","resolution":{"observed_at":"2026-08-01T01:07:44.637103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.639843Z","title":"F., and Zamir, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.639843Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d9f4e272e7795e65f81094098e60090ea43584dbdcc018d75ce7e560d0853e48","observation_id":"e20b6ef7-64f0-4595-bb30-89d2b3923bdc","resolution":{"observed_at":"2026-08-01T01:07:44.639843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.642417Z","title":"M., Xing, E., Yang, M.-H., and Khan, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.642417Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:52f9cad5cce5f5a2159ff916bd06f8d142bf646bb42ac5a31e424451440ac5c5","observation_id":"b1647729-333d-4f06-a5b1-be01b9d3a2d3","resolution":{"observed_at":"2026-08-01T01:07:44.642417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.645119Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.645119Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:bb9c324cfe1b81d24279e5abb533555d517807183cd7242c84c53e5d75cc91aa","observation_id":"880ba2f5-b222-4e83-acf9-aee1a6cc14e7","resolution":{"observed_at":"2026-08-01T01:07:44.645119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.647782Z","title":"Prom3e: Probabilistic masked multimodal embedding model for ecology","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.647782Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d453403741d71a13e5c7766e24628483317b8f503d42a80dd86577d1922729ea","observation_id":"1478dea4-1425-4e93-88d6-705cc436ecc5","resolution":{"observed_at":"2026-08-01T01:07:44.647782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-08-01T01:07:44.650363Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.650363Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:3502316c37a6c7dc520dd807b45e6082c91513706b5471162f4746df64220af1","observation_id":"ac39a35a-4a55-422e-9216-ad3a863fd25e","resolution":{"observed_at":"2026-08-01T01:07:44.650363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-01T01:07:44.653249Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.653249Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:5b7123a0c5fdcaf3c09392bc88a271ba259badc8df10a102d77781617c852885","observation_id":"2d7e7bd2-ad2d-4f4a-b135-a3568746643b","resolution":{"observed_at":"2026-08-01T01:07:44.653249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-01T01:07:44.656625Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.656625Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:4791b6a2e69619234d2a2b4f130d5367757ae58243e15415007faed6826e29c7","observation_id":"9195b562-99db-4c78-a94f-fed84208ecac","resolution":{"observed_at":"2026-08-01T01:07:44.656625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.659459Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.659459Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:d429cb5111d8508a9fde30f84ac9f1d787912ae4773d08b19a5c5eae563974e7","observation_id":"9698ebde-4dc9-42dd-ba28-bea7d9a92224","resolution":{"observed_at":"2026-08-01T01:07:44.659459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.662232Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.662232Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:488aa21081ae05ffafaab80e4b8de1ebbc4ccfee9fb32ed7caf605440122d267","observation_id":"6ca3e55d-0779-448e-8486-4fe10a976446","resolution":{"observed_at":"2026-08-01T01:07:44.662232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.664753Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.664753Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:6290ddea0d03ef85076bab6a5ed5b6f19e0437bd4cf47145d6f9b3a6015901d5","observation_id":"29e518d6-f0d9-4c7c-bee8-09f1be1f2fc1","resolution":{"observed_at":"2026-08-01T01:07:44.664753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.667673Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.667673Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:4e3e393e6038e47ea2fc0c8ab46a626e184e34228825c29cabb4ed23655af49a","observation_id":"fde2313f-77c4-4f3f-a550-f60b3721a6b9","resolution":{"observed_at":"2026-08-01T01:07:44.667673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T01:07:44.670179Z","title":"F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., Hénaff, O., Harmsen, J., Steiner, A., and Zhai, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.670179Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:6b20bee3646893b9e27649e932c6515450453386cb4deb38f6770f010cc50478","observation_id":"2657e103-86f4-42af-aa21-92b1bed1d70d","resolution":{"observed_at":"2026-08-01T01:07:44.670179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.673237Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.673237Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:bc450dd80e931325053408d744c864d41d4100860a4b7cc5ebbc0b62ecf66112","observation_id":"8de3e3dd-05d3-426c-8048-2cad7032dd68","resolution":{"observed_at":"2026-08-01T01:07:44.673237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.675843Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.675843Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:1d21a44c442ce049deac9445944c3f12f022bdf35e12a6b735d071ca1fdd4848","observation_id":"26baf85d-08aa-4ae1-b2c4-84a14ef23af2","resolution":{"observed_at":"2026-08-01T01:07:44.675843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.678831Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.678831Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:4313525b56ff80a5a3e124b6be3aca990c1ee510f0e147b99133f158e22a234b","observation_id":"923d5874-0203-4783-b7c6-ec6fb541cb08","resolution":{"observed_at":"2026-08-01T01:07:44.678831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-01T01:07:44.682002Z","title":"DeepSeek-VL2 : Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.682002Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:56e67a14300d25e91ef4009c606abf9cf81f040f2fd0726b3d41020fbc5d12ba","observation_id":"0057a862-fe17-4014-aa9f-b6fbc922aaa5","resolution":{"observed_at":"2026-08-01T01:07:44.682002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.685026Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.685026Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:40fb6769a5c1bf1bfcb9a179835d91e7681104d57c0a18582529d8ac421fed05","observation_id":"1249a70b-02c1-44e4-89a5-113a54cdf00d","resolution":{"observed_at":"2026-08-01T01:07:44.685026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.688020Z","title":"Depth anything v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.688020Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:19c29fef2880624347b9651979e09b659d2210a6e95609a4d4e72f3938de1399","observation_id":"a8e2b309-34a5-40cc-aa63-50de98138b5f","resolution":{"observed_at":"2026-08-01T01:07:44.688020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.691254Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.691254Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:10c5165957e4a92e10936fb4d9ec0006378cc5b1e8ea6d549b453801a0d3d5ba","observation_id":"c7270472-a27a-40fc-88d8-d1abc4abd4b7","resolution":{"observed_at":"2026-08-01T01:07:44.691254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.693989Z","title":"Inference-time scaling of diffusion models through classical search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.693989Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:aa5372cad293e0420e11ac8095f34cb19200ef73fb7c83bebbe04e52e1e7b07c","observation_id":"26cba2ae-6af0-431b-b1f6-cf3c4e82515b","resolution":{"observed_at":"2026-08-01T01:07:44.693989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-01T01:07:44.697581Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.697581Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:9ba69cf4e25dc3aec7462b4cdfd4678257580e87a05ae2fb34341309264d4120","observation_id":"7e75de20-d6fc-47f2-86bc-d4b90408546b","resolution":{"observed_at":"2026-08-01T01:07:44.697581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:07:44.700601Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T01:07:44.700601Z"},"links":{"citing_paper":"/paper/2607.25948"},"observation_digest":"sha256:dfa7096f0927b77c20140b90aaae485477dede6212aea5e37508fc4940bd61a2","observation_id":"6d48867f-a489-449a-9428-abae43d5dd2e","resolution":{"observed_at":"2026-08-01T01:07:44.700601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25948","last_updated":"2026-07-28T16:34:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T02:17:43.694081Z","submitted_at":"2026-07-28T16:34:23Z","title":"MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2607.25948."}