{"as_of":"2026-08-07T05:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5260875d3ebd6c18c02500676a0815d30f40097839149d91edebf2a04058518","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:15:30.256170Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06137/citation-record","integrity":"/paper/2507.06137/integrity","json":"/paper/2507.06137/citation-record.json","paper":"/paper/2507.06137"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07112","last_updated":"2024-12-10T01:57:17Z","snapshot_observed_at":"2026-07-06T20:04:20.826875Z","submitted_at":"2024-12-10T01:57:17Z","title":"Maya: An Instruction Finetuned Multilingual Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07112","snapshot_observed_at":"2026-08-06T19:15:25.391619Z","title":"Maya: 25 An instruction finetuned multilingual multimodal model.arXiv preprint arXiv:2412.07112,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.391619Z"},"links":{"cited_paper":"/paper/2412.07112","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:e7afc73a2bb02f48a5a1eda383dba9ef065337e79d0b2a8be6948d7792ac5c31","observation_id":"cb33f64b-e506-4043-9aba-00eb31d940d3","resolution":{"observed_at":"2026-08-06T19:15:25.391619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:15:25.702878Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.702878Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:48d52fa7fe2f0ae3ee7dfe094ab22098d4bdc825cec595f032d89e3a4ebd5168","observation_id":"631a2c31-c178-42c3-bb22-427e5ee31236","resolution":{"observed_at":"2026-08-06T19:15:25.702878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T19:15:26.468458Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.468458Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:7bc2be7fa66adfdd6920e76614ca574dbdd0b62c07d61b77017ec69d0cb72c39","observation_id":"9946d252-2a16-4bd1-a9e0-50e93c74d681","resolution":{"observed_at":"2026-08-06T19:15:26.468458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T19:15:26.683136Z","title":"Evev2: Improved baselines for encoder-free vision-language models.arXiv preprint arXiv:2502.06788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.683136Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:1551659cfe311fa034de8cdec8d9ea71fc9fd3fc2068e8c927d2307cdc40cb0b","observation_id":"b134bd5a-39fd-43cc-9b02-961aba8666fb","resolution":{"observed_at":"2026-08-06T19:15:26.683136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-07-06T20:54:04.912422Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-06T19:15:26.807532Z","title":"Unified autoregressive visual generation and understanding with continuous tokens.arXiv preprint arXiv:2503.13436,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.807532Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:cee23a62049f4e6237d48ea0476973e66ce921ac5ecdade2a1d279edea5747fb","observation_id":"254445f6-6f51-42b2-a357-beb673a5d945","resolution":{"observed_at":"2026-08-06T19:15:26.807532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16092","last_updated":"2025-06-02T15:04:03Z","snapshot_observed_at":"2026-07-06T17:21:46.980522Z","submitted_at":"2024-01-29T12:02:28Z","title":"Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16092","snapshot_observed_at":"2026-08-06T19:15:26.989066Z","title":"Multilingual text-to-image generation magnifies gender stereotypes and prompt engineering may not help you.arXiv preprint arXiv:2401.16092,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.989066Z"},"links":{"cited_paper":"/paper/2401.16092","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:f42f56b892ed84c85d581335a5b0a32358f0869024019be0e32bcf917128e7ee","observation_id":"d72cfab3-18e6-48e9-91b5-a235dabc64fd","resolution":{"observed_at":"2026-08-06T19:15:26.989066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T19:15:27.073467Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.073467Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:403bea7ab60a92e0370f929c5edd291121b7287accab4d1ab32a5483fd850a43","observation_id":"30340b37-b221-4601-8d44-65aa3e124624","resolution":{"observed_at":"2026-08-06T19:15:27.073467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T19:15:27.198563Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.198563Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:28c1e3a4e4f6a89a252c7f940f5db826efecdc6eb26567a746f708d8691ad79b","observation_id":"d2d36bcb-25a6-48a7-9c07-3895644aefac","resolution":{"observed_at":"2026-08-06T19:15:27.198563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-07-06T10:02:48.167825Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-08-06T19:15:27.347457Z","title":"Query-key normalization for transformers.arXiv preprint arXiv:2010.04245,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.347457Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fce4505c2a6a4e1e827bf38cdca9d0004f4e0ac19160cb135da53651d30a2b84","observation_id":"31ce32f2-439b-4933-86bf-cfb3c1f8858f","resolution":{"observed_at":"2026-08-06T19:15:27.347457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T19:15:27.441402Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.441402Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:24fc3df2e64c5befbd15956441b71f5ebddd72bfce6842180b9de66ff12985a5","observation_id":"4f5c16ae-896a-4719-b33c-75995bd231c8","resolution":{"observed_at":"2026-08-06T19:15:27.441402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T19:15:27.601678Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.601678Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8e655f4e74ece9fe324dc5fb284520cfa1c4e34f39182165124c86fde7e60f41","observation_id":"c15b6851-c074-4f8b-a2f5-436b3e2d4194","resolution":{"observed_at":"2026-08-06T19:15:27.601678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16777","last_updated":"2024-03-25T13:53:04Z","snapshot_observed_at":"2026-07-06T17:50:09.945123Z","submitted_at":"2024-03-25T13:53:04Z","title":"Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?","version":1},"cited_work":{"arxiv_id":"2403.16777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16777","snapshot_observed_at":"2026-08-06T19:15:31.074335Z","title":"Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?","venue":"cs.CL","work_id":"5c7f4894-dbf1-42f0-9622-5d5bb4b96774","year":2024},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.773933Z"},"links":{"cited_paper":"/paper/2403.16777","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:28fad10082354239065ebf8e3603819eda2d93802335ba7aff86fdf24007e92e","observation_id":"d218fce7-2b80-471a-a9a3-58b2ca2c4d28","resolution":{"observed_at":"2026-08-06T19:15:31.199854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-03T01:52:38.727865Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-06T19:15:27.932896Z","title":"Uni- token: Harmonizing multimodal understanding and generation through unified visual encoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.932896Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:e77858fe0db5b820278294e84c31a68512279f746a925933c1a8404137c31846","observation_id":"1b1501ce-e4d0-4e53-970f-12d20944505e","resolution":{"observed_at":"2026-08-06T19:15:27.932896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-06T19:15:28.033284Z","title":"Fasttext.zip: Compressing text classification models.arXiv preprint arXiv:1612.03651,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.033284Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:9c7a6d2cd55703e0ab95a19c75753590b4ab2dd0745cda145f49646490932f85","observation_id":"6b08cd28-f79d-4bcf-a796-148f67398d29","resolution":{"observed_at":"2026-08-06T19:15:28.033284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-06T19:15:28.124600Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.124600Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ce234a96d4918cb162e8e01759fd0f927dea2a99883f5db770cc5a3460dc252c","observation_id":"3fe09f47-9a25-4651-a236-9982132ba8f6","resolution":{"observed_at":"2026-08-06T19:15:28.124600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T19:15:28.211962Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.211962Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:96b17b5bdb467c4945b75c6e926c4f2b2c41ea88458cbd3ee9bfbcc9630e92a3","observation_id":"b8005ad2-6a13-410c-84b9-50cc38d8ebab","resolution":{"observed_at":"2026-08-06T19:15:28.211962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T19:15:28.270949Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.270949Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ff5fb81f4c36b8c5c7363deed850ae9850e9efb8c717fbe038444d02eda863c1","observation_id":"25c1158c-f34c-409b-92e5-072b748233c3","resolution":{"observed_at":"2026-08-06T19:15:28.270949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:28.353210Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.353210Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8d64dbca96def193ac5134479ce35a5df8629a2f44007daea9cedf86ddd29160","observation_id":"a9136bbe-be09-4210-b494-91e210e38659","resolution":{"observed_at":"2026-08-06T19:15:28.353210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T19:15:28.431651Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.431651Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:12112dc56e80a5e5a9f91cbe728758a6d402d2ada39df960db68a53981efceb9","observation_id":"ecf123eb-7021-4755-aed5-e17f9c720df3","resolution":{"observed_at":"2026-08-06T19:15:28.431651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-06T19:15:28.550123Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.550123Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:e0ac78e275387cb2a9c8a7a986f4362563b1a673217b16693a9b789aa4bd61e3","observation_id":"e539eae7-006a-408a-b50f-4dc91a831b44","resolution":{"observed_at":"2026-08-06T19:15:28.550123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01827","last_updated":"2025-07-08T00:51:16Z","snapshot_observed_at":"2026-08-04T04:01:49.750596Z","submitted_at":"2024-12-02T18:59:53Z","title":"RandAR: Decoder-only Autoregressive Visual Generation in Random Orders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01827","snapshot_observed_at":"2026-08-06T19:15:28.641209Z","title":"Freeman, and Yu-Xiong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.641209Z"},"links":{"cited_paper":"/paper/2412.01827","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:327f7daea1102764f096eb07e7fdd414f406207e4eb58d59a54781a9cc3941c7","observation_id":"84849d24-f5bc-423b-8b0c-b90328786bee","resolution":{"observed_at":"2026-08-06T19:15:28.641209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T19:15:28.700319Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.700319Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fcefe2c0fa5fcb6f26b3da25c386898628e9517f545fc00f6b40cc34726b8bef","observation_id":"87a9d507-2af6-4aa2-8ef5-fccc3ff0a297","resolution":{"observed_at":"2026-08-06T19:15:28.700319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-06T19:15:28.767123Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.767123Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:722ecad134ef54cc3bace3f81e550ea0afd21c6ccc14533fa746cac1b14eec43","observation_id":"ef5c483c-58d7-44d2-a74d-067543e4b338","resolution":{"observed_at":"2026-08-06T19:15:28.767123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T19:15:28.869995Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.869995Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:61cd6e53c8b92d1550472f0698afde6171ce57ae4b6d6b1b639f7d94c0688120","observation_id":"f6e251c7-9a5f-43f2-861a-702c69504870","resolution":{"observed_at":"2026-08-06T19:15:28.869995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07072","last_updated":"2025-04-29T07:52:17Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:43:16Z","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","version":2},"cited_work":{"arxiv_id":"2504.07072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07072","snapshot_observed_at":"2026-08-06T19:15:30.719597Z","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","venue":"cs.CL","work_id":"71aa3c46-6c6b-4a38-895b-f628f117220a","year":2025},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.957234Z"},"links":{"cited_paper":"/paper/2504.07072","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:9a43a97a4b115d0928c8168264cf1e2932b4105fcea6d1c7d50747352d6378f8","observation_id":"c4138b83-579b-4ade-b54e-9356f01811d9","resolution":{"observed_at":"2026-08-06T19:15:30.797941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-07-06T21:08:01.403325Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-06T19:15:29.024903Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model.arXiv preprint arXiv:2504.08685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.024903Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:9b1a2b66ebec7176b02097171a8bd8054f94c548cd1c26d491ad5a5e5042eb80","observation_id":"8a5f9eb3-2c81-4037-8a93-fffaf842bcaa","resolution":{"observed_at":"2026-08-06T19:15:29.024903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16677","last_updated":"2025-04-23T12:52:49Z","snapshot_observed_at":"2026-08-05T20:20:10.159248Z","submitted_at":"2025-04-23T12:52:49Z","title":"A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16677","snapshot_observed_at":"2026-08-06T19:15:29.104588Z","title":"A post-trainer’s guide to multilingual training data: Uncovering cross-lingual transfer dynamics.arXiv preprint arXiv:2504.16677,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.104588Z"},"links":{"cited_paper":"/paper/2504.16677","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fb7af13c8bc673dd121392ef88695035cbe4acdd203d71bd24b666c4da2b0d9e","observation_id":"d4245c9d-9cff-43e8-a9f2-9c0a2cb82fd8","resolution":{"observed_at":"2026-08-06T19:15:29.104588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-06T19:15:29.193312Z","title":"Global mmlu: Understanding and addressing cultural and linguistic biases in multilingual evalu- ation.arXiv preprint arXiv:2412.03304,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.193312Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:15be499ad36142cb063e6d382921a738cad1aeb094976bbef95a1412124258ab","observation_id":"750250b7-ee98-4417-a503-cce1a9612577","resolution":{"observed_at":"2026-08-06T19:15:29.193312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-08-06T19:15:29.272159Z","title":"Dualtoken: Towards unifying visual understanding and generation with dual visual vocabularies.arXiv preprint arXiv:2503.14324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.272159Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:022f739e19782142674a789bdec620fe17193180801ee09895f53fa83a8c5c04","observation_id":"5ef95c25-ff74-4ac7-9f6d-d791075b3e6f","resolution":{"observed_at":"2026-08-06T19:15:29.272159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T19:15:29.335024Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.335024Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:906f4648cebd3af1fcaf491bbcdfb5e78fc65912fe6cfef74040db8ba1a266cb","observation_id":"c52fc6c6-c3b3-4d9a-9b8a-4a1a76eff23b","resolution":{"observed_at":"2026-08-06T19:15:29.335024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T19:15:29.406317Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.406317Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:30b2909f32960ef948ef069a07cff7eb359b64eb9f1a0de086646904fcd77cf1","observation_id":"0ccf7602-5185-4563-bf83-13478538a945","resolution":{"observed_at":"2026-08-06T19:15:29.406317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T19:15:29.476204Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.476204Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:a783732a090c4513f7672e6944473f252efffa6dbe9cd05de990e6fc10c8b10c","observation_id":"84989b3e-ab84-48c4-b495-ada5ae199b79","resolution":{"observed_at":"2026-08-06T19:15:29.476204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-06T19:15:29.556430Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.556430Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:9308f16aba92d5262ed84ac3f1d90ead388bc157aa0496a34cdb956fb26c4131","observation_id":"bcb76d96-db31-412a-9d90-ada7b793bf4f","resolution":{"observed_at":"2026-08-06T19:15:29.556430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T19:15:29.647335Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.647335Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:9740faf99a009c756fa9ac5582f5ed8b9e27117960a132eec71f89e67cf6be55","observation_id":"823772c9-11de-4d68-86e5-bef1879fb05d","resolution":{"observed_at":"2026-08-06T19:15:29.647335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11501","last_updated":"2024-01-29T23:09:49Z","snapshot_observed_at":"2026-08-04T05:22:43.823766Z","submitted_at":"2023-04-23T00:04:14Z","title":"Lost in Translationese? Reducing Translation Effect Using Abstract Meaning Representation","version":2},"cited_work":{"arxiv_id":"2304.11501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11501","snapshot_observed_at":"2026-08-06T19:15:30.439579Z","title":"Lost in Translationese? Reducing Translation Effect Using Abstract Meaning Representation","venue":"cs.CL","work_id":"547233b3-3d2e-456b-9c6b-833f6828b656","year":2023},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.734374Z"},"links":{"cited_paper":"/paper/2304.11501","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:b427fe223efc3da7f716664847aa0c0fd1a79869753dc23c546c947c8771aeb5","observation_id":"b6d61fb3-5fe1-4f19-beca-242e2c1675b5","resolution":{"observed_at":"2026-08-06T19:15:30.527154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T19:15:29.821240Z","title":"Tune-a-video: One-shot tuning of image diffusion 31 models for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.821240Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:43448deca4c1f083423af5daa457225bd1726c35c0413662a07350656847465f","observation_id":"9950c082-bd59-48a2-b4f5-f46c7fa7a7a6","resolution":{"observed_at":"2026-08-06T19:15:29.821240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-06T19:15:29.901066Z","title":"Sana 1.5: Efficient scaling of training-time and inference- time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.901066Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:2f406186c3443be8f92915a92d03b29c89d867990bbab5d86eed20259154a73d","observation_id":"1d9384ee-5dea-4cc9-9f23-c46383ba6e3c","resolution":{"observed_at":"2026-08-06T19:15:29.901066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T19:15:29.991196Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.International Conference on Learning Representations, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.991196Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8d2b38566b3df4acdb52e1a2debd75f02c3f29913706cea8a83ada0d6851da33","observation_id":"a32ea1f1-dd39-4029-90ad-51333bebfebb","resolution":{"observed_at":"2026-08-06T19:15:29.991196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T19:15:30.054891Z","title":"Language model beats diffusion– tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.054891Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:66d3a4816d3ec11055999ef51f6b3b5a788f4e39893848fcdb3eb2f0bbb406ec","observation_id":"d24a4c6c-7837-4d13-84c2-e59c8f7621c1","resolution":{"observed_at":"2026-08-06T19:15:30.054891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-06T19:15:30.153376Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.arXiv preprint arXiv:2309.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.153376Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fa34b5b5a13ba850b903161e9aa3f45774b7b08cadc3f0feec6a15cc0c35bbc1","observation_id":"edc4c914-eb9e-4cdc-a452-ca4cdb0daf9f","resolution":{"observed_at":"2026-08-06T19:15:30.153376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:31.693885Z","title":"Table 7 outlines the key hyperparameters used across the three pretraining stages and two instruction tuning stages ofNeoBabel","venue":null,"work_id":"89b6938e-eec3-4691-bd4a-befe6ed74752","year":2000},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.256170Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:2ff7deb7d23811571d4922588cd76734aa993eb78d1855a393ca878c5384d021","observation_id":"19bb7719-1b68-4860-ba77-6496cb8cccf0","resolution":{"observed_at":"2026-08-06T19:15:31.763902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T19:15:26.147148Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.147148Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:7645b332a6cec2106d9270ef10470bb6d034945797a3c15f6ef72c0a964bfd8d","observation_id":"fa08158c-384b-4894-a205-04d72179bc66","resolution":{"observed_at":"2026-08-06T19:15:26.147148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T19:15:26.005732Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025b","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.005732Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:837757436fbc013a11dd093e2f3d75bc2dd3ae2704ecb795f765a95d42bef2aa","observation_id":"434fee0b-cea0-43fa-991e-e6853c4146ec","resolution":{"observed_at":"2026-08-06T19:15:26.005732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-06T19:15:25.901325Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.901325Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:6d755a1da2fdf2b8d49b922f04a152b06bb88e9de7de6a2bdad5822a7581d87f","observation_id":"0e4f07a4-8b8b-48ae-b291-2ac684ddf55b","resolution":{"observed_at":"2026-08-06T19:15:25.901325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08751","last_updated":"2025-05-13T17:03:48Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:03:48Z","title":"Aya Vision: Advancing the Frontier of Multilingual Multimodality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08751","snapshot_observed_at":"2026-08-06T19:15:26.315533Z","title":"Aya vision: Advancing the frontier of multilingual multimodality.arXiv preprint arXiv:2505.08751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.315533Z"},"links":{"cited_paper":"/paper/2505.08751","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:c118a1d863f246f85c9aae4d2ea9b052f96342033aee797c6e7e23c199cee187","observation_id":"c37b8bb7-1171-42e1-97a6-dfa957596b5c","resolution":{"observed_at":"2026-08-06T19:15:26.315533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12158","last_updated":"2025-05-23T14:59:46Z","snapshot_observed_at":"2026-07-06T21:25:37.773959Z","submitted_at":"2025-05-17T22:35:40Z","title":"The AI Gap: How Socioeconomic Status Affects Language Technology Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12158","snapshot_observed_at":"2026-08-06T19:15:25.790040Z","title":"The ai gap: How socioeconomic status affects language technology interactions.arXiv preprint arXiv:2505.12158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.790040Z"},"links":{"cited_paper":"/paper/2505.12158","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:5328d44677f48d5f96107de1363628424ef39292aaad095ae528dde7ef3ef615","observation_id":"47cea15a-199a-409b-b992-c139363e0bdf","resolution":{"observed_at":"2026-08-06T19:15:25.790040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08910","last_updated":"2025-05-15T04:24:06Z","snapshot_observed_at":"2026-07-06T21:23:28.579575Z","submitted_at":"2025-05-13T19:01:12Z","title":"Behind Maya: Building a Multilingual Vision Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08910","snapshot_observed_at":"2026-08-06T19:15:25.470790Z","title":"Behind maya: Building a multilingual vision language model.arXiv preprint arXiv:2505.08910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.470790Z"},"links":{"cited_paper":"/paper/2505.08910","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:cffa1245bd73cfa44165eb63eac1674fe1efbf6436e43da02aa4448f920812a7","observation_id":"6843ef6c-36d7-4520-9596-96ea59f178fc","resolution":{"observed_at":"2026-08-06T19:15:25.470790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22724","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:31.470456Z","title":"The translation barrier hypothesis: Multilingual generation with large language models suffers from implicit translation failure.arXiv preprint arXiv:2506.22724,","venue":null,"work_id":"7cfe4327-2968-45ec-a072-c14395a9ac22","year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.568660Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:266c0f3b601da3ec29ef8a7f95124116b73a2df7417db645fe4dbf08ee0f7da4","observation_id":"f2b6346c-e4f2-4a19-a54a-ad7d8a06a3b4","resolution":{"observed_at":"2026-08-06T19:15:31.575544Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:07:49.541358Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.06137."}