{"as_of":"2026-08-21T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95959fbf5bfaaaedbbcd06acd108cb5d86862424650a83a71d10283467e0e81b","coverage":[{"denominator":131,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T01:12:13.426640Z","state":"measured"},{"denominator":168,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":168,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":68,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:59.990040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-08-19T20:56:01.756093Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:3e1da1cc6cddd3d8b4f32b2a5c612caf77d9d08a32cddce0a8182266702d58b6","observation_id":"f6d047db-2a61-435b-af07-280e9e5a2503","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:d2ea315a7818a5deda1e4d2f9c993a487a1048a134c0bd15e33ceeb425fcfa2d","observation_id":"e85d8781-85a1-40a8-981f-bcbd8cbbbdc8","resolution":{"observed_at":"2026-05-21T14:50:14.634653Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-03T05:23:31.119886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:31.119886Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:93421d7138e1ee6f637eeb17814ab2d2d7f14f748e58e1cd8b74cd455aed448f","observation_id":"7b9833f7-cfc6-4a0f-a2bd-19d1152d0294","resolution":{"observed_at":"2026-08-03T05:23:31.119886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-14T11:55:14.305551Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:d6bc222e05eaa4bcafd76f212c047e841aa9d27b6d1a6df2798810bb3fabadc0","observation_id":"39446122-d597-4d44-8273-4b70f81fc342","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-17T04:04:11.658659Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:0edcee423cc0bda8732b679673b9bf719f3bb568fdb371dfa8be72c6170f924f","observation_id":"3a721f1f-b528-43cd-9b49-b910113cc8c1","resolution":{"observed_at":"2026-05-21T13:00:09.819893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-02T18:25:52.604284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-17T08:00:37.590775Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:52.604284Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:2f854b4fbe108496c846ed194c4829453026d2e820a0b0b069a6af7ed1bf96a3","observation_id":"35772a41-bbc4-4737-b365-352d08d46ff9","resolution":{"observed_at":"2026-08-02T18:25:52.604284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-03T02:30:57.284292Z","title":"arXiv preprint arXiv:2510.26583 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-13T01:45:01.629353Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.284292Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:68367b8d45c7e537af3d866e7b1c8d2b9a046fbb74f3cd9b0cc34b718d337b9c","observation_id":"900bf7e2-3b1b-486b-aa15-3b9281c21bf4","resolution":{"observed_at":"2026-08-03T02:30:57.284292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:537e6d427f1dd1822cceb9fa365c7527b64ad0da61df769cfc8ace5cd6f7c717","observation_id":"e272cddb-bc6a-4a9a-a8dc-f77c87098087","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:776d47f7404abf9aea8bc5cabeb913388b4994e221d560e476db5d5311fbaa06","observation_id":"3b0d5a40-e62d-4bcd-a180-c53f7d1e3158","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:75d3d7a93b8097f5a2ec75efa32acda93864242f1428b95c7c8bc348ea64d89f","observation_id":"fd8475af-1a91-4dc4-829e-7d65da4558c1","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-15T16:01:06.700036Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.551829Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:af37925028d7467812aa0a24c251e760dec1bd5b909633f21c23083e3ebb6fc0","observation_id":"bd1eadb0-4071-4a9d-bdce-b13e5ebca823","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.10784","last_updated":"2026-05-19T19:12:18Z","snapshot_observed_at":"2026-08-15T16:01:06.700036Z","submitted_at":"2026-04-12T19:19:04Z","title":"TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T08:59:10.877437Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.10784"},"observation_digest":"sha256:472a154286861b2cd102015de11aae00facc5c9479859c4fb3ef7776519e7ee0","observation_id":"5569b540-477f-47fc-b365-ba8de8784322","resolution":{"observed_at":"2026-05-21T08:59:55.280611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-18T03:55:24.837739Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T06:03:06.920592Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:4114000f8eff6668f20bd479c26f08c28fef5c88b35b66fa3499e8c9d065eb02","observation_id":"5550148e-c7ce-44ce-9847-34e2951046c7","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-18T03:55:24.837739Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:58.232585Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:2ab64bddd100355dbfef77b88a4d61230783206bc43cd23f053640daa263f1d9","observation_id":"0d443724-2970-41cf-83f2-5b1bd40d2526","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:42:41.112158Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:361a16b6ec8508416ee5e9741d0d5e02a230ea4407f2f5199af04f3038f5f21e","observation_id":"e455f6a8-2414-4623-9b14-f094bd6ba615","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:705487b5cd9b66599f33b1a82d69b2d508f3c217c014d7aaa3f433b076f04de5","observation_id":"19177e61-0370-4e00-b196-c64d4bda4c92","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-17T20:18:26.984377Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:d7a85873e149c49042304cbbdb928555bc83ce5209213798c7a384c55a46794f","observation_id":"9a89ef6d-d376-4227-83b6-4641923932c2","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-08-17T20:18:26.984377Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:5817d291bb7340c08837c4c832a0c5ec240f4fd21152319a7171be31709b38fa","observation_id":"0a6cd5dd-dda3-41c9-b163-87feb64903e3","resolution":{"observed_at":"2026-07-05T11:41:02.738836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-08-11T06:12:30.304597Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:880592ac1cea59db9c163ef3265496e235daffc6d047892013b3db000fb8cb15","observation_id":"a0ee33fa-5819-4e27-96ce-84c4528d6fbe","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-08-16T05:47:41.086994Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:956f0c866a51fe13528c2f7273cd9e560e21a3f2821a05c2ca46052a76a34520","observation_id":"f2aacf6d-66d8-4a3b-9069-1c8944a7aa32","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:10596382c8ac63fbeed8a2a68ec5cdc6d5c27b6953f76c51b5106f8aedf99f51","observation_id":"2cf5a54f-e46d-4384-9f6d-6eea870b9d79","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:e2d9de667a437accfc1341f5aede2c7661ba6a336205e2e3d8d171315f53a2af","observation_id":"43c9d681-bb25-43b8-b687-61e13146f13c","resolution":{"observed_at":"2026-05-20T23:43:51.071493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T10:40:04.767657Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:ae56e853ead2153bc3591dc671c50a664223a3819226307e51e8cd34da83dfbb","observation_id":"82a09e16-f052-425c-ad12-0dc305fdaeb4","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:20:04.435904Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:9437a31ba7f3b661c7ab27f5fe4448becab05e1a77e5a7e82bb587d98bd70c31","observation_id":"580e768a-833a-4f20-bb57-70499ac369c6","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:9426de87592b9070995649d6cfabee6a16a5fca5257660e65090ee1fbc2743ba","observation_id":"1475be14-4922-4694-ad74-01d9705f3368","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:f282c09edd7f1b80e40575c3e4a94bce371c86867271a88e9c717e5b79dfd1e2","observation_id":"389f1f92-6c60-4f67-a9ce-bb8d79c483e7","resolution":{"observed_at":"2026-05-21T08:19:52.730252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.08163","last_updated":"2026-05-04T16:21:25Z","snapshot_observed_at":"2026-08-15T03:16:28.209720Z","submitted_at":"2026-05-04T16:21:25Z","title":"MULTITEXTEDIT: Benchmarking Cross-Lingual Degradation in Text-in-Image Editing","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-12T01:11:35.480399Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.08163"},"observation_digest":"sha256:1f80fdcf4ddd521dbe61ad2b4d855b32c6c96b42c55cfcdaa3c30b032bea7981","observation_id":"0b36d08d-7b99-4d1e-a604-508c19f83d2f","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-11T12:41:01.722526Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:39.114660Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:0fead7ef65bad8195ec562630fc488e9f7efbd90cc4bd629ebddeb9a798c4647","observation_id":"fa20c607-f838-4b49-99d9-706f2225c779","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-11T12:41:01.722526Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:55.933311Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:19ce0b9d16ebd160a305a1370eb0355c56b439ad07bfa7234d70549a23099bcd","observation_id":"e33e2eea-d06b-4c15-ba1d-632fae2e7cf2","resolution":{"observed_at":"2026-07-01T14:05:46.685305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:ff90650cc0c40a7ddc57d80c69da1ec6611b258d3b8ba31209e38ec7a47938e2","observation_id":"15f8e895-b4ee-41ae-abcc-e9c546de505b","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.13062","last_updated":"2026-05-13T06:33:54Z","snapshot_observed_at":"2026-08-17T02:25:29.632988Z","submitted_at":"2026-05-13T06:33:54Z","title":"Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:22:20.464966Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.13062"},"observation_digest":"sha256:d755b1cd533a884b7f17813623fe120f1e9b82d753e8c41761a991da250afbea","observation_id":"79afed4e-be56-4a06-b432-c406a2b5fb51","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:9ba00a99424af388eddce447c2a1ee9a2a2066e440dde240ab8e564bec9ecfc2","observation_id":"b7561dea-ddb6-4f83-bada-794f63a097c7","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.16842","last_updated":"2026-05-16T06:59:54Z","snapshot_observed_at":"2026-08-15T19:41:50.414367Z","submitted_at":"2026-05-16T06:59:54Z","title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:03.005508Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.16842"},"observation_digest":"sha256:f0f3c5a5b1745e5b137673580a8ae06a9009e7d4b250be8e33de30eaf3ee131e","observation_id":"773d1a32-1274-4cd2-bb7f-56a356d6077e","resolution":{"observed_at":"2026-05-19T21:22:48.576713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.17766","last_updated":"2026-05-18T02:35:05Z","snapshot_observed_at":"2026-08-14T10:08:29.810470Z","submitted_at":"2026-05-18T02:35:05Z","title":"LatentUMM: Dual Latent Alignment for Unified Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T12:39:28.058049Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.17766"},"observation_digest":"sha256:f300fc20b3f5d09ae03301b43de4ed76ae8be807942b014460b812df96a4ca1a","observation_id":"5d8a8294-0514-4bf0-aaba-bbad823299a8","resolution":{"observed_at":"2026-05-20T12:43:17.378868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:de1e3313c54f00d2d343cdd248e82e0eb0bbb23f058f6ce2e1694fc5ddd10746","observation_id":"14d14ed3-5410-4461-8c61-f7459cdc3b32","resolution":{"observed_at":"2026-05-20T11:48:14.949487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:529bdfeb22ee6f3da5028696c637d6f0feeac6fc3ab96d8010b0dbe6fbea485d","observation_id":"9813bfcc-dc4c-435b-92d1-de6b9fce24e2","resolution":{"observed_at":"2026-05-21T07:59:50.460568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-15T18:55:38.055612Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:71f6753e9e018160a2b76a63cc280f8d13385358c8c906a6b294449f1764da49","observation_id":"e880fb75-7176-44fb-bcbf-ac24bb537257","resolution":{"observed_at":"2026-05-21T05:19:39.390736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.21487","last_updated":"2026-05-22T09:11:59Z","snapshot_observed_at":"2026-08-19T14:47:26.910421Z","submitted_at":"2026-05-20T17:59:42Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T04:33:51.535737Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.21487"},"observation_digest":"sha256:5e791153c578ade959d28d4a5e1a6c39ae3c5830b9d72f513a3583974a080642","observation_id":"cdc50307-8237-4bd7-b4ab-b319acbfe5f8","resolution":{"observed_at":"2026-05-21T04:33:57.702602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.21487","last_updated":"2026-05-22T09:11:59Z","snapshot_observed_at":"2026-08-19T14:47:26.910421Z","submitted_at":"2026-05-20T17:59:42Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:43:38.328972Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.21487"},"observation_digest":"sha256:347949200e56de99180627d100036c0af12cc6620ba3259ab9607103fb375ecc","observation_id":"aa556b57-17a9-4ca9-a115-0d8dcdca9832","resolution":{"observed_at":"2026-05-25T05:45:24.103941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-08-16T15:52:17.416464Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:70b203203b2e9580abbdf242387c0a259f6a3fafea5e539cd64efe91a7f46755","observation_id":"cbbe4208-39bb-4712-98d5-1a512b26d723","resolution":{"observed_at":"2026-05-22T06:41:10.530534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.25254","last_updated":"2026-05-24T20:59:08Z","snapshot_observed_at":"2026-08-14T19:35:15.687497Z","submitted_at":"2026-05-24T20:59:08Z","title":"Guess the Unified Model: How Much Can We Recover from Generated Images?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T11:53:36.715338Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.25254"},"observation_digest":"sha256:86c86a1ad7133258bc62a5db18006406cc0beb37453def75ab4461c0eb4b6f02","observation_id":"140741fe-ff67-4980-b9e1-07e38a88ec69","resolution":{"observed_at":"2026-06-30T11:54:38.156916Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:c8725435fb47e55516fcfcf95a929ff06721876b39997747523910cb031a1bf5","observation_id":"a9c42e88-73f1-40ec-a5e0-8feb6ef22e79","resolution":{"observed_at":"2026-06-29T23:04:02.010989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.28805","last_updated":"2026-05-27T17:56:04Z","snapshot_observed_at":"2026-08-15T02:33:40.368894Z","submitted_at":"2026-05-27T17:56:04Z","title":"OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:01:08.529979Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.28805"},"observation_digest":"sha256:752b4b3d2aa024956b612b30085311d16725474191954a374932edf7ef6440eb","observation_id":"8a02ef79-98bd-4a09-9d19-104b173be02b","resolution":{"observed_at":"2026-06-29T13:03:26.008261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:54.292448Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.30248"},"observation_digest":"sha256:293352de3f841aae0e843560eae87043f1cd7b4e1845270cd7dc20da07bf7682","observation_id":"c48ecdcb-6dd0-44f8-8d91-44428270f8f5","resolution":{"observed_at":"2026-06-29T07:43:13.990845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-08-12T22:21:00.037802Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:f2f396a41ed29ef3bf787fead895d305c8531b48be38f6f3650cb9a8d311b3ef","observation_id":"771fcf27-c3a8-4744-b39e-0acfddc9fc4b","resolution":{"observed_at":"2026-07-03T00:57:29.767850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.11770","last_updated":"2026-06-10T07:54:42Z","snapshot_observed_at":"2026-08-16T12:02:50.724922Z","submitted_at":"2026-06-10T07:54:42Z","title":"SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T09:59:02.899488Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.11770"},"observation_digest":"sha256:604d4d8d70fb06c9333c78bf3628f49a62eb40a9679a5fcf25c89b7c5b7b82e3","observation_id":"ec2e823d-d79b-49a7-bf2f-91a6de4b514d","resolution":{"observed_at":"2026-07-03T10:27:56.940777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.13679","last_updated":"2026-06-11T17:59:50Z","snapshot_observed_at":"2026-08-12T10:38:27.260916Z","submitted_at":"2026-06-11T17:59:50Z","title":"InterleaveThinker: Reinforcing Agentic Interleaved Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:42:34.126336Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.13679"},"observation_digest":"sha256:65aee1387daa6455a2419df2d42943cf9905c638247b2c112cb21519db749001","observation_id":"5c1f5286-4b7a-4218-935f-241361e74011","resolution":{"observed_at":"2026-07-03T15:08:32.891341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.17937","last_updated":"2026-06-16T13:45:17Z","snapshot_observed_at":"2026-08-12T12:10:12.944078Z","submitted_at":"2026-06-16T13:45:17Z","title":"ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T00:51:05.494085Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.17937"},"observation_digest":"sha256:1ba62d00dea3afc96d360cecb91be16c94e05ab11af8737742a5bbd0a634c0ef","observation_id":"93da6e2c-168e-4ab1-b890-5b0c353b7d09","resolution":{"observed_at":"2026-07-03T21:08:58.669938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.19004","last_updated":"2026-06-17T12:31:44Z","snapshot_observed_at":"2026-08-13T14:58:28.448658Z","submitted_at":"2026-06-17T12:31:44Z","title":"Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T19:06:16.100762Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.19004"},"observation_digest":"sha256:4360af29a07fbfc674fec3ca83f6b171784833cd7ac222dcf301fa2edcd283a2","observation_id":"15e506a9-738a-4495-880a-c09e55965272","resolution":{"observed_at":"2026-07-04T02:49:24.716057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-12T23:14:12.939313Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:5477a370323e4e3efe59e0f0b6c9225056681b2da086e20b9a16ecc3d4e32b9b","observation_id":"1e143c10-f618-42d0-89f9-0fa70d00660e","resolution":{"observed_at":"2026-07-04T16:39:58.262161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:25fc89d87a3ba1919ecfe3855a5748598fcb24fd2ba5a3897430fefd8361c012","observation_id":"2d629f4d-3d9b-4062-835c-089727b01795","resolution":{"observed_at":"2026-06-30T08:14:26.581955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-02T09:39:33.426324Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:33.426324Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:8da37049951c79a546bfed4460e2293687c728833698c6d300dbb886a0216bf9","observation_id":"afc89459-cb70-47f4-b347-1321ce527ceb","resolution":{"observed_at":"2026-08-02T09:39:33.426324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.30054","last_updated":"2026-06-29T09:45:15Z","snapshot_observed_at":"2026-08-14T12:34:00.326381Z","submitted_at":"2026-06-29T09:45:15Z","title":"Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:04:07.327934Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.30054"},"observation_digest":"sha256:bed5c1508f88e77c2d0eb72ab650d005749671c7bf5fc10b013f619b89a27b20","observation_id":"fc548f2a-8da7-4b01-ad31-a5bd8568a2e9","resolution":{"observed_at":"2026-06-30T06:04:20.886608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:ddbb03c1038d94d74f7951db9f1060312aa5383facf1410974330c56dbf611bf","observation_id":"c98223a1-3a5a-450e-be53-536016f92f0f","resolution":{"observed_at":"2026-07-01T10:25:41.921325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-12T02:19:35.281990Z","title":"CoRRabs/2510.26583(2025).https: //doi.org/10.48550/ARXIV.2510.26583","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03461","last_updated":"2026-07-03T16:18:20Z","snapshot_observed_at":"2026-08-13T15:02:26.120680Z","submitted_at":"2026-07-03T16:18:20Z","title":"WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T02:19:35.281990Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.03461"},"observation_digest":"sha256:85082e172136bf4dfa080c8b946f59f31ad123fe83da33b029a91206b97dac89","observation_id":"e011d6fd-0809-420a-9206-5f96753abb7d","resolution":{"observed_at":"2026-07-12T02:19:35.281990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-12T00:14:19.104498Z","title":"Emu3.5: Native multimodal models are world learners.arXiv preprint arXiv:2510.26583, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03748","last_updated":"2026-07-04T07:40:43Z","snapshot_observed_at":"2026-08-19T03:39:45.295752Z","submitted_at":"2026-07-04T07:40:43Z","title":"Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:14:19.104498Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.03748"},"observation_digest":"sha256:678f7f19d5dcd138559fb023f2f9ec991e2b1e1810b2b4cb8bec415375996f26","observation_id":"cc9f7a43-ac6f-474c-b24a-723647ad2864","resolution":{"observed_at":"2026-07-12T00:14:19.104498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"5: Native multimodal models are world learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-08-04T06:57:07.480777Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:cbe8968d3a2cea8ca7ac20e380358fea6c8e7939d8037d486c7fa82a602e0d35","observation_id":"cb592d58-ace3-4024-9f75-e9503c792d2b","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2607.08434","last_updated":"2026-07-09T12:54:05Z","snapshot_observed_at":"2026-08-18T22:18:54.026766Z","submitted_at":"2026-07-09T12:54:05Z","title":"DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-10T07:31:26.225257Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.08434"},"observation_digest":"sha256:e295425dc3f1364c0ac4f650dcc259acb1593eeb1913dd937df1331d9891ef83","observation_id":"3006de00-dcad-4461-b36d-110c524b0510","resolution":{"observed_at":"2026-07-10T07:36:58.019384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:8fd249d66a7ac4dc1a71f871b3fcda85a4f83b304005cbdfaeaa6550ffe5ece3","observation_id":"92e9c856-d691-4660-876c-8410059df1e1","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T22:47:41.067461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15619","last_updated":"2026-07-20T04:43:29Z","snapshot_observed_at":"2026-08-19T16:28:22.769236Z","submitted_at":"2026-07-17T04:35:36Z","title":"StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T22:47:41.067461Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.15619"},"observation_digest":"sha256:ea10e17b355880d52d6236f00014fce97a09d72fd8de8f697d04096e14ae0a51","observation_id":"34bac566-138c-4b8b-bdb0-dcae302bd551","resolution":{"observed_at":"2026-08-01T22:47:41.067461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T13:38:59.844112Z","title":"Emu3.5: Native multimodal models are world learners.arXiv preprint arXiv:2510.26583, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-19T05:52:04.295365Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T13:38:59.844112Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:7f8663f2135fe52773336fa7c6e16ec1c28c4ee5698a5ee0895e90206f95e4f3","observation_id":"42c2eeee-3ea5-4ec5-abb1-324f0b42951a","resolution":{"observed_at":"2026-08-01T13:38:59.844112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T08:39:36.784561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-19T14:09:20.412548Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:36.784561Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:0403c9f4a5fc18cc9b7bf441142dfc3b76b1ba8946f534f3c130f2989d2df3ce","observation_id":"cfe40d53-b601-4d15-800a-1e0873088288","resolution":{"observed_at":"2026-08-01T08:39:36.784561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T06:05:50.098846Z","title":"Emu3.5: Native Multimodal Models are World Learners.arXiv preprint arXiv:2510.26583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-19T06:03:20.718776Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.098846Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:2b076f9c3e0ae9710fd017de5839baec5c472a8fbf53b829cb9a9acd24dc2a94","observation_id":"72283a80-6ac1-414d-989d-5a71c8d3f60f","resolution":{"observed_at":"2026-08-01T06:05:50.098846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T01:54:37.817600Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25641","last_updated":"2026-07-28T12:27:25Z","snapshot_observed_at":"2026-08-14T10:27:56.889346Z","submitted_at":"2026-07-28T12:27:25Z","title":"OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:54:37.817600Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.25641"},"observation_digest":"sha256:d35229b55c1eef130fb2e4339f038ff1f5fdd23904c9d1adba451f99d7be5cac","observation_id":"5c246877-d4d8-4903-bf19-87dc913028fe","resolution":{"observed_at":"2026-08-01T01:54:37.817600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T00:46:23.384170Z","title":"5: Native multimodal models are world learners , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-15T19:21:14.650632Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.384170Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:f3168ba2e36f2dfb23db6b7312d6af964dfe126f1fdf2efe973e99f5bb360200","observation_id":"21ec4f14-3bc0-4c65-89fa-f8a76171e5b3","resolution":{"observed_at":"2026-08-05T00:46:23.384170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-07T00:13:38.055689Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02711","last_updated":"2026-08-13T08:47:57Z","snapshot_observed_at":"2026-08-16T23:09:53.016959Z","submitted_at":"2026-08-03T17:57:11Z","title":"Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.055689Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.02711"},"observation_digest":"sha256:2c0822e7c5ab1f50bbcaa31e424ed5fb1048ecda2c6fb7148724ba8918e446de","observation_id":"4d53c8cd-bbf0-441d-b4e5-540f6a860e8f","resolution":{"observed_at":"2026-08-07T00:13:38.055689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-07T00:15:37.958795Z","title":"Emu3.5: Native multimodal models are world learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-14T21:30:19.211524Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.958795Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:4ad6c3b4da2accc6fdfdc184a5719cde7f31b1ce23ce5ce059b046c5fa588154","observation_id":"3ae2b93c-2391-4649-8aea-bf48113677a2","resolution":{"observed_at":"2026-08-07T00:15:37.958795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-14T04:34:59.990040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-21T10:52:33.292138Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:59.990040Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:a16e331952206bf2740c94e8105a964f9a34f55e867d729f3f03f2bd842adbc4","observation_id":"d8a3a56c-eb6e-4729-a48a-1510864321de","resolution":{"observed_at":"2026-08-14T04:34:59.990040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.26583/citation-record","integrity":"/paper/2510.26583/integrity","json":"/paper/2510.26583/citation-record.json","paper":"/paper/2510.26583"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:a8cf85b2bc46f71096e42ad4d94091eef8a70a55714d412f9873e0596610952a","observation_id":"22c3e724-4a22-4659-acc2-a1b148d5b13c","resolution":{"observed_at":"2026-05-18T01:12:13.685502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:0a7b5bda0d15144145213208d7ccde81c118e58f9226e49fc65e74af47a716f5","observation_id":"f7c019b8-984e-4390-a746-08f421e500ad","resolution":{"observed_at":"2026-05-18T01:12:13.629916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5: An ai assistant by anthropic","venue":null,"work_id":"53ba745e-6c3a-4ef5-b8ef-0aeb77791f85","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:d1cae547fa64ffcebc8d8f73f5fd65bedb56177432eb44b0b8afabcad1b6be01","observation_id":"31ac4d8c-5c96-431f-9dad-d90d2164b4b9","resolution":{"observed_at":"2026-05-18T01:12:13.721953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The chosen one: Consistent characters in text-to-image diffusion models","venue":null,"work_id":"0d80ca5e-65a4-4786-9edd-009f12b8e7ea","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:944d1c60c8bb82af1f82da936ab66cd08ec766248f1e7bc46bfcbc4b2f6422aa","observation_id":"fa6a8267-4b96-43b8-b9f4-d5d8103fabf1","resolution":{"observed_at":"2026-05-18T01:12:13.724912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:fdea4bf6351835489647ba20ad2028f3bcd7b7dc3ecb257d3f7ce9ef01bf1017","observation_id":"9a960c7f-f3ff-4341-be5c-2f77286b509c","resolution":{"observed_at":"2026-05-18T01:12:13.656605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions.https://cdn.openai.com/ papers/dall-e-3.pdf","venue":null,"work_id":"4314fee3-e298-412f-a0a6-e3555c1272b0","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:3c10cf7c7b1f8cabcd8d2c3ed708a591ffef163d944d99b9846c1eedd739a5da","observation_id":"c77f1912-16e6-47fd-bfff-100e39170382","resolution":{"observed_at":"2026-05-18T01:12:13.727363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:53.918127Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"fd7a4946-0389-427a-bb45-c75d5e7c48c3","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:f0e8dee7e5d7babc51f2a77499101a8060d5404d466ca7316cf98f72d441dfa8","observation_id":"d26faa91-7994-4244-a6c5-96c5e73265dd","resolution":{"observed_at":"2026-05-18T01:12:13.730610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:fa631e95d0d08b865600203c3c03be0678ba2c185ec0ad6f22b34f9d755ab293","observation_id":"b3c29c2b-d468-48a9-8659-e1e421197366","resolution":{"observed_at":"2026-05-18T01:12:13.482985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset","venue":null,"work_id":"0766f0c1-5524-4ddc-b962-6e81328faa8d","year":2022},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:85f448806e7c9fcc629fdd4d876992c158c433e157613402fc0f961adcf945be","observation_id":"073cd66e-f006-41e3-8698-411ccea589ea","resolution":{"observed_at":"2026-05-18T01:12:13.733812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-08-14T05:30:11.702159Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2505.22705","doi":"10.48550/arxiv.2505.22705","metadata_source":"pith","pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","venue":"cs.CV","work_id":"68d4c0f7-3dfd-438d-a823-6a93fd0a835d","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:4abb1845b1128544f55b962934b35098895422014d53ded71685160005e9764d","observation_id":"f4217f92-b9a0-4c3a-bfd6-c74a315df1b0","resolution":{"observed_at":"2026-05-18T01:12:13.637118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flash diffusion: Acceler- ating any conditional diffusion model for few steps image generation","venue":null,"work_id":"2b812a4f-78fe-45bb-84c8-cd14ab5f916f","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:20aa9ea5bd2229259ce88ca65aa842861e24e9a9f86435fafd8a3508c5964816","observation_id":"692f1dc0-35f6-49af-8546-cda699a05ef7","resolution":{"observed_at":"2026-05-18T01:12:13.736854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-16T19:31:18.122184Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"cited_work":{"arxiv_id":"2506.07977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07977","snapshot_observed_at":"2026-07-04T13:39:51.249678Z","title":"Oneig-bench: Omni- dimensional nuanced evaluation for image generation","venue":null,"work_id":"1b87af32-6bef-4951-a841-9ea611693ca6","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.07977","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:a1605329da1b034d6aafe55161119a5dcda6af752fbd5ef29695178c8cf012b0","observation_id":"7074b797-ab45-45af-9c31-e98a5a625764","resolution":{"observed_at":"2026-05-18T01:12:13.675245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web- scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"0ff0425f-8793-463a-aa5c-99ec4d935003","year":2021},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8d9fd827fdf767645b8ea4228ace6c9eff30244cf64acf2d7c78afb4f8bd3e31","observation_id":"19919518-d516-461f-825c-fd9d6b083d99","resolution":{"observed_at":"2026-05-18T01:12:13.740368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17188","last_updated":"2025-03-24T16:16:20Z","snapshot_observed_at":"2026-08-17T14:13:06.380960Z","submitted_at":"2024-11-26T07:55:57Z","title":"Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment","version":2},"cited_work":{"arxiv_id":"2411.17188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17188","snapshot_observed_at":"2026-07-03T17:58:47.366322Z","title":"Interleaved scene graphs for interleaved text-and-image generation assess- ment","venue":null,"work_id":"f9301973-0140-4f55-bb08-047f063097a7","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2411.17188","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b1947ef75e3e48df2e68753b448c7299af86b6ee663da857ebb903994221aab2","observation_id":"23603f50-c379-484c-ab6c-d34654ecbce7","resolution":{"observed_at":"2026-05-18T01:12:13.497603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:319f59151aa2b66803009d015dde18f5b19abd916634649cddef637111c962b5","observation_id":"cdb517c1-64f1-4e75-b036-5b9d17c4ff32","resolution":{"observed_at":"2026-05-18T01:12:13.520072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b8ee7dbe4b19165d1012b6480c0fae140a80958126430715e32a6307db6c9027","observation_id":"5aa384f7-4c39-4008-bbee-35e3365c1c77","resolution":{"observed_at":"2026-05-18T01:12:13.530814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06905","last_updated":"2025-08-26T12:18:14Z","snapshot_observed_at":"2026-08-21T09:20:14.638824Z","submitted_at":"2025-08-09T09:36:21Z","title":"MultiRef: Controllable Image Generation with Multiple Visual References","version":3},"cited_work":{"arxiv_id":"2508.06905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06905","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiref: Controllable image generation with multiple visual refer- ences.ArXiv, abs/2508.06905","venue":null,"work_id":"3e0621d7-e923-409c-bdc8-dda26731f95b","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2508.06905","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:bf8ee7132449cbad715cbca27b095a08cb7777e6042dfed1273d5e9b6038b5bf","observation_id":"45131fa5-f0a2-4284-ada6-c5bd38d6af30","resolution":{"observed_at":"2026-05-18T01:12:13.556070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10741","last_updated":"2025-06-12T14:28:12Z","snapshot_observed_at":"2026-08-17T12:02:39.970782Z","submitted_at":"2025-06-12T14:28:12Z","title":"PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework","version":1},"cited_work":{"arxiv_id":"2506.10741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10741","snapshot_observed_at":"2026-07-02T12:36:57.268463Z","title":"Postercraft: Rethinking high-quality aesthetic poster generation in a unified framework","venue":null,"work_id":"6750b614-982f-458c-aaa7-c20a95c76b9b","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.10741","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:17f9d84be56f0ddb48e108032d7d22212a26fe135d75a6a77a5dd688a132e56b","observation_id":"e11ce4b4-d839-4d1d-9251-13d47c24cab1","resolution":{"observed_at":"2026-05-18T01:12:13.611804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:fad8289380be8494850f8accce9f1ce93cf82a4a76c321b8ca03e9da50738649","observation_id":"d1993717-6c22-45a7-8da8-70a31188512b","resolution":{"observed_at":"2026-05-18T01:12:13.626429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bagel: a web- based bacteriocin genome mining tool.Nucleic acids research, 34(suppl_2):W273–W279","venue":null,"work_id":"a04e3c23-a990-4395-8097-d92c07d30837","year":2006},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b29895c1ae455cd8fe5643fbaf62b61c0d8a82454ff5a4f106fce0654f3a80af","observation_id":"aa97f3af-a802-4178-a1b1-fa0b2b49ad38","resolution":{"observed_at":"2026-05-18T01:12:13.743456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"insightface.https://github.com/deepinsight/insightface","venue":null,"work_id":"bca588f4-3e08-4958-94b5-650ff2e586e0","year":2021},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c64d576d3e7e47c11d97ae7216be5574a4b5efcf1fc1cd309115b5817bf38cea","observation_id":"108c810a-5ce7-4e9b-9833-5c38a2b2e838","resolution":{"observed_at":"2026-05-18T01:12:13.746308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:03:40.152421Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":"e88f7222-3e8e-41a6-b3e3-36964716b0bb","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b877f46631babe7fffeacfb31d57c3e094ea642b0a5f6f83a86a604ccaa5ae69","observation_id":"108fac73-3b76-4455-9a43-09c042f7fe64","resolution":{"observed_at":"2026-05-18T01:12:13.749078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":"477de22d-6cd8-4648-96e7-dd77c0b42189","year":null},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:0efe2776a1d3752dc43f774bfc6334baf14d7f36f64b4a1e4f071da2741cb6b4","observation_id":"78e84d4c-532e-4ba0-ab53-b35db87139bb","resolution":{"observed_at":"2026-05-18T01:12:13.752334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24717","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.742677Z","title":"Uniform discrete diffusion with metric path for video generation","venue":null,"work_id":"46e2b2d9-625d-40fc-9e32-3a068b28e74f","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:ba7edfcc62de2cf7147e74812e97ac0b69e8873b7f540b5ab2c80f786146e2e4","observation_id":"11fc43eb-8bd3-43e4-b5f8-463c8ad640ae","resolution":{"observed_at":"2026-05-18T01:12:13.471400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.791740Z","title":"Retinaface: Single-shot multi-level face localisation in the wild","venue":null,"work_id":"21f82a64-273b-46c1-9f30-2f0314b82132","year":2020},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2ceae8aa65e1982b5f417d8ffe7a6bd8215729aa6b2e44b27f7e09ac3ef3b57f","observation_id":"5424ae77-2b00-428c-9543-9bf10ead96bb","resolution":{"observed_at":"2026-05-18T01:12:13.755853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.047391Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes","venue":null,"work_id":"4d349026-15b1-433b-ace5-5104109b2bef","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2e0a78e1f81ffdc36c4e5270d2821d5cef917bd6408074a2e137f1addb8b253d","observation_id":"a2ee46ab-e5ee-46b6-b264-8e342353d1da","resolution":{"observed_at":"2026-05-18T01:12:13.490601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"741a0a17-c2b0-4fd1-b5d8-e9768879d0c0","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c3f83310f11f570a0095b8b827cbdf2de226d3a7c55ef17dbaa4d547cc46005c","observation_id":"cd3675af-ace2-49ff-b443-1acb0bd85838","resolution":{"observed_at":"2026-05-18T01:12:13.758767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:36:03.280140Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"efdd8568-38ef-4a4f-85e1-0b5c2b288584","year":2021},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c6c84ff031407db41064bdb061cc8bf371a49c47a95edabd72bf4c09c49365e2","observation_id":"0c832447-bb02-4501-a2cc-82b42bdc220d","resolution":{"observed_at":"2026-05-18T01:12:13.762096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems, 36:27092– 27112","venue":null,"work_id":"534093c2-5b51-4d6b-b3fa-974309af2112","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2277fdc00023ae68a2a600589b73512785851f3454d1c2779e0f653e688671bb","observation_id":"c384ecdd-b071-44c0-b1ec-afd351e22510","resolution":{"observed_at":"2026-05-18T01:12:13.765390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-08-20T09:46:38.792377Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2504.11346","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-07-04T07:29:38.429370Z","title":"Seedream 3.0 Technical Report","venue":"cs.CV","work_id":"013e56d0-7f47-4d0e-bbca-e9540fc0e0cc","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2a85f01e986218a0b684d0eb87ce2932c8e64c2f13c7ae607277ef122d535194","observation_id":"2f61a95d-cb7e-49ee-9db5-03930dc3cb3b","resolution":{"observed_at":"2026-05-18T01:12:13.541450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discrete flow matching.Advances in Neural Information Processing Systems, 37:133345–133385","venue":null,"work_id":"79989718-9686-4b5b-8aac-5c6ed0777f2c","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:a2f66ed6f1f6a37f475c75af0eae4ba8163f7c45700911ebbdc12aba2ce46337","observation_id":"891cca51-81e1-4132-a405-5057cb9a82b6","resolution":{"observed_at":"2026-05-18T01:12:13.768172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:1371381b504be53db6c3570fc0a32dd1ad8b9c5e3f10c21a3b6a73bfdcea072d","observation_id":"1006dae3-4b1b-47cf-856a-808dbe738fe7","resolution":{"observed_at":"2026-05-18T01:12:13.566047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-15T19:53:33.201174Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":"2507.22058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-07-04T13:39:51.493261Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again","venue":null,"work_id":"3ee0ee57-31b9-49d4-98fc-c12c499a14b9","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:37eabb4fd426c2ee50156cf885097caab90f96c6ac6117ab9eff05440d6676d4","observation_id":"a0bf2467-64fc-4bdc-a16e-27a87faa2575","resolution":{"observed_at":"2026-05-18T01:12:13.587424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"da77a247-4444-4e2f-ae9c-aa2d7cb181a3","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:30bd26fcaed2fa3746edf38f556b6805aec22f9edcf82c6b1f25a3b4e295a36c","observation_id":"a573a1be-f126-48ee-9657-904ff3c374f9","resolution":{"observed_at":"2026-05-18T01:12:13.771449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 flash.https://developers.googleblog.com/en/ experiment-with-gemini-20-flash-native-image-generation","venue":null,"work_id":"b846fa36-f7e0-4330-b976-11c6ebf2372c","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c0bf4055eb6395ae8a51ae67a22aadc2898b985b7b9a49150ca7080ac33630fe","observation_id":"f7d3aedd-eca1-43c0-8745-e8f2d4f75e62","resolution":{"observed_at":"2026-05-18T01:12:13.774805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagen 3","venue":null,"work_id":"d3929713-43a4-44c1-a09a-f09ba156aa52","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:791a0224058c904216f4a0869c78f9c599c158c1570305b0d4cf049409a92cbb","observation_id":"f2cd30cf-4bad-447a-8c0a-855d26c1d5c5","resolution":{"observed_at":"2026-05-18T01:12:13.777738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagen 4","venue":null,"work_id":"c37aef30-bac2-46d6-ae70-4f2f1ab4797d","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:40370366fe42318e12567e266c4f51e4bb3b165e1e484a962418594551d1cc72","observation_id":"0f118b8a-a3f0-449e-9018-9d6034243968","resolution":{"observed_at":"2026-05-18T01:12:13.780361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-18T09:10:03.802508Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":"2410.18558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-07-04T09:59:44.997303Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":"f63b5594-3d56-4965-9657-b11d801dcbe7","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2bb4ad410051e2d418988a28a74c355a32417a726c68ec62e0f5ae8cb6b1e654","observation_id":"933d34f6-4ffb-4fd8-ae93-ffb88ebe1745","resolution":{"observed_at":"2026-05-18T01:12:13.653172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":"266c2ab5-b69d-4c83-b94c-325c1759d904","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:77684ed25ae132786e6300b428cc4dcf9c3c88a8253d5d9c1a83fcc75e9d8a3c","observation_id":"2c3082ae-d2ce-416b-a07b-17141474286e","resolution":{"observed_at":"2026-05-18T01:12:13.783517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring colorfulness in natural images","venue":null,"work_id":"f010760f-4286-4e16-a2cc-0fcdcc1e761a","year":2003},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:870c618f06648d5f9e280bd743049229db56cc0aae7f94d2a45c4f4ec665d71c","observation_id":"59721299-0f79-4859-ba53-888479184049","resolution":{"observed_at":"2026-05-18T01:12:13.786783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:d4d0b1412727ffb9627c78a61fce1f32fbd4d7df8376476f727e41b0dd73870c","observation_id":"2f28fe49-1ccd-4cc7-a525-605679157759","resolution":{"observed_at":"2026-05-18T01:12:13.682211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T19:44:04.936110Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":"6c2969ce-c757-42d4-b16e-f5996f5e0623","year":2017},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:cb73bd290b14269ce9b7ca787888733ee5e0a1f135a1b9ae4b7b2aa56e37925a","observation_id":"6d142b67-4384-4967-ab09-8a0121a0e674","resolution":{"observed_at":"2026-05-18T01:12:13.789672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lego-edit: A general image editing framework with model-level bricks and mllm builder","venue":null,"work_id":"e73e5190-cf66-42a8-9ea5-6129f94703e1","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:471badc284541c2e021c49cdb4269a777362e343c3bc8b1dd199387bf71afe12","observation_id":"19bcfd07-38fd-4444-89d6-fac2afc1f9a2","resolution":{"observed_at":"2026-05-18T01:12:13.475603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16418","last_updated":"2025-07-29T01:42:34Z","snapshot_observed_at":"2026-08-16T12:48:10.512851Z","submitted_at":"2025-03-20T17:59:34Z","title":"InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity","version":2},"cited_work":{"arxiv_id":"2503.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infiniteyou: Flexible photo recrafting while preserving your identity","venue":null,"work_id":"d5261a7a-f06e-4989-88c2-39e1b116204b","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2503.16418","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2ac05c07c20dec76446bc354cae32f8617dd759b0c46f464bd2a19e282c069f3","observation_id":"ce6bc978-0ffb-4818-844a-414e6ead6f70","resolution":{"observed_at":"2026-05-18T01:12:13.479387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.729548Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"d4028a91-9152-4f10-95b7-edb74a2f0e38","year":2021},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:66ffc39024c7eba39addcabbfa4c94d73cd26f119149f508cb91662293d70f4e","observation_id":"1ac987de-fa1e-4ad1-9375-c2cf1bc9ad6f","resolution":{"observed_at":"2026-05-18T01:12:13.792561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.729325Z","title":null,"venue":null,"work_id":"869eebf2-3d18-4b82-94e9-73563a64db9d","year":1956},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:5510f145798df1665cc8b061f62c6a303e5d346c7ef42bd0afb2e4394e6ab8d9","observation_id":"622f510a-35ac-42ce-87a3-7b71bed633cc","resolution":{"observed_at":"2026-05-18T01:12:13.795238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:24:48.423236Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"4286b247-177a-4d5f-aa88-c483f25a7dac","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c639f39fecc3b1c6615927ffc374da291ce6db5ce8c3a4843e35d681c6fad676","observation_id":"62e3ca79-76d4-41bd-8f5e-9e4373267ef0","resolution":{"observed_at":"2026-05-18T01:12:13.798118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux.https://github.com/black-forest-labs/flux","venue":null,"work_id":"58cbdc17-155a-4101-a43b-dd4d5f68f5db","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:266f51ae2292b0db17746028e4c5169ef4b57d443d53f63f7b236345da10aca3","observation_id":"088f4e04-7532-45d3-9ac1-529fded71c20","resolution":{"observed_at":"2026-05-18T01:12:13.800832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8679892a47f4db141d4fed2fa206df7636aacc8db648e5588482f458581c68ea","observation_id":"39c2e95b-f16d-41ca-a164-b12167a709ce","resolution":{"observed_at":"2026-05-18T01:12:13.527168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":"cbc78ad8-5314-471f-8bcd-2c07dff652dd","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:d7c551cca3e1c46146ca3716428771771b5ce3244e6c135150dae7094d9f9e5a","observation_id":"954be859-f10a-466a-b4d2-1f9796993024","resolution":{"observed_at":"2026-05-18T01:12:13.804599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:3196e7ed7d6d7eaa44fe218d947e37b8020fdbcf5358a8df195d6a3a5b422879","observation_id":"b941330f-2654-44f9-ae65-3526696db315","resolution":{"observed_at":"2026-05-18T01:12:13.537985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinity instruct: Scaling instruction selection and synthesis to enhance language models","venue":null,"work_id":"a0c9dee1-ace6-4c56-8154-ff3b2279f328","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:fee4cb4a5e248b0b057f62114705176d3b248e52deb89a51fa48f839bdefd47f","observation_id":"10165464-9ec3-435a-9dfa-43bb34e3e5fe","resolution":{"observed_at":"2026-05-18T01:12:13.807953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:29.668820Z","title":"Sekai: A video dataset towards world exploration","venue":null,"work_id":"019b873e-99fa-4bf3-b771-a76531c86aa7","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:98383f4e2c80697695f288ec7b3be1f48947023cb9c77a7d84157b90711e70d5","observation_id":"1ddd2c17-163f-4151-a9a9-3f8db59b066e","resolution":{"observed_at":"2026-05-18T01:12:13.549220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:785e27eb7e39bec34357884319bc25d0e5e77144848eb7f2dc490f3e13002dd8","observation_id":"8e9c6323-696b-4644-a8d2-a3115c9915aa","resolution":{"observed_at":"2026-05-18T01:12:13.552554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:44:36.379087Z","title":"Focal loss for dense object detection","venue":null,"work_id":"02fb8d6a-3afe-4c67-8c54-f28607578511","year":2017},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:cae085cc0425677d0b3039427636c8d454e7b042271a345067821f86001b8f85","observation_id":"8d00c863-c005-42f1-8086-6686d7dabc88","resolution":{"observed_at":"2026-05-18T01:12:13.810928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:aec600ce338fa34b3c625fbfa6de8555058fe2698922544525268329eb5457ff","observation_id":"118e3dbe-cb2d-437b-979c-9ee26854c37e","resolution":{"observed_at":"2026-05-18T01:12:13.559401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1191d1e0-5e80-4225-a064-e1c04d70e44d","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8ac44a6e4561c654622613ae21d77b0095fb6b5acc80b63b4f880b7619fbe4ec","observation_id":"4fe847ad-4b8e-4dd8-bfdf-12fd48fd0cba","resolution":{"observed_at":"2026-05-18T01:12:13.813942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:78c45d5300a005b8e8ebbf8d82547a04523a21f80cdc6ad90598559844e5f18b","observation_id":"386bc1bb-2611-4e77-889e-0fdac997a5ce","resolution":{"observed_at":"2026-05-18T01:12:13.576502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:36:03.299527Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in neural information processing systems, 35:5775–5787","venue":null,"work_id":"2a8cb2eb-1fec-4593-bd88-054a4c96d82a","year":2022},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:974cd84bc92ec975b855ebc8ccf4bc3adef4a59a4e0947829270a31adba40073","observation_id":"089739e2-63ab-436a-b08e-e4c46c79e9af","resolution":{"observed_at":"2026-05-18T01:12:13.817237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":"2409.04410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-04T13:09:50.831210Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":"a2523977-d17d-43e1-8c06-1f6ba1c28388","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:cebc27f6c3779b003658c362a6f7b537a10c39dc4eca2aeb3515645b4e68e066","observation_id":"5b1bf519-4281-4e10-b7fa-ecf85beb41a6","resolution":{"observed_at":"2026-05-18T01:12:13.590977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sit: Exploring flow and diffusion-based generative models with scalable interpolant transform- ers","venue":null,"work_id":"d04e2e33-efae-4cd3-8322-2b3fa9cbb74a","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:de68ffea453c1d3802d35a1a98a2b12c1f5273609acb9c448733326f3d2244fa","observation_id":"9cae939b-c162-4840-84b3-a6cf7cffaa01","resolution":{"observed_at":"2026-05-18T01:12:13.822757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midjourney","venue":null,"work_id":"7e805adb-435c-4d32-88c2-19d736aca29f","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:e3d8b6bba279005f56341ef5d59ec1591aca3af89da0c349cfe688e584795e55","observation_id":"ef8df658-3626-4a2b-8800-6ba11319e378","resolution":{"observed_at":"2026-05-18T01:12:13.825443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o.https://openai.com/index/introducing-4o-image-generation","venue":null,"work_id":"29ee9ab7-172c-4b6d-a438-11be31d5c814","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:a126e12a7927e6cf33fceb57a7b040db421a789f1f9fbc0251f423a4f80f76cc","observation_id":"3f0db7fb-514b-49df-adaa-bc3f883a4e7e","resolution":{"observed_at":"2026-05-18T01:12:13.828223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image generation API.https://openai.com/index/image-generation-api/","venue":null,"work_id":"9d7ee2f7-0da8-4e8e-a93e-4bf406665157","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b9cbdc4be10aefd2cb43296d78d776acc89a17a520eed778d222db9b47d9e274","observation_id":"818aa069-da24-46d4-a6b6-0b8dc183df5d","resolution":{"observed_at":"2026-05-18T01:12:13.831098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:1ae4859102d793cde137a9e2cc11900741661b0ce8aeadd5c4ed3aafd835313e","observation_id":"27d1099d-0c6e-468e-afea-399088f35863","resolution":{"observed_at":"2026-05-18T01:12:13.640216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic 40 learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"b19ded97-37b6-4839-bf85-094155bbb100","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:f9132ae62cce4f18ddea000d49faa47390b58d312751aff5be9b2b523a795035","observation_id":"8da3dbca-297d-467a-897c-74210863a038","resolution":{"observed_at":"2026-05-18T01:12:13.834011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"bc997ac9-e88a-4a7f-a2bf-819fd9d96132","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:ac99550e8196d929b27dc28a2d07de8d2bef762fcacdcd67de69b93974504626","observation_id":"0cf2164b-b9b0-46ef-8a1a-53a5b7a0d03a","resolution":{"observed_at":"2026-05-18T01:12:13.836812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14482","last_updated":"2025-08-17T13:06:03Z","snapshot_observed_at":"2026-08-17T21:16:46.071759Z","submitted_at":"2025-03-18T17:53:29Z","title":"ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing","version":2},"cited_work":{"arxiv_id":"2503.14482","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14482","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ice-bench: A unified and comprehensive benchmark for image creating and editing","venue":null,"work_id":"2a461b1d-e027-47db-a2ad-242869acfddb","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2503.14482","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:c7afb05bc6deadde92cd3a3d2c5fcf22769e2d52d018764f93237d58561e84dd","observation_id":"be314694-5e33-48de-a68d-eded2df1b19a","resolution":{"observed_at":"2026-05-18T01:12:13.660625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-08-17T19:22:44.145403Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2212.09748","doi":"10.48550/arxiv.2212.09748","metadata_source":"pith","pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable Diffusion Models with Transformers","venue":"cs.CV","work_id":"a3a05169-18b1-42bb-8775-eada50163437","year":2022},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:30f840054325ca7634f8d2eb75b0e7d49956b2abcf1f52197e422b7a503dbf74","observation_id":"5d59952a-bf9e-46c5-8b02-12ff9887d1a7","resolution":{"observed_at":"2026-05-18T01:12:13.664255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"71ac3d5c-9f10-45e7-b2f3-098d7125d6cb","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:ca22a285691df837ba30b94fa831c773e35bcd94213ec7d4ee02dff6494f3ae8","observation_id":"b2edb98c-1047-4507-ae84-f427a3d890cb","resolution":{"observed_at":"2026-05-18T01:12:13.840924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:42.267245Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"df748bf8-90bc-4699-a0f5-ab532ce692e1","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:e71d0b620a44eb2243d9dcd15aac56a1ff06ede969f420755481447a1bce502c","observation_id":"3d1e6416-407b-452f-be09-65236acf5898","resolution":{"observed_at":"2026-05-18T01:12:13.844425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recraft.https://www.recraft.ai/","venue":null,"work_id":"e50c79c0-b738-4d3f-98e4-0ab4ffd6e925","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8dc34498108df3456d71984d312fdd1d004c8b587da4b207d082bff6e65db16d","observation_id":"cafbb9c9-9ab5-4935-a2bc-47a3d2800170","resolution":{"observed_at":"2026-05-18T01:12:13.847335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"b3cb4a90-62aa-4455-8e2e-e6b2c7dc5add","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:d45d5cdd8b7ea60cdf95d70211b66a40651983e3dd9e8301a8b6dceb1fd572ee","observation_id":"cf75fe7b-e3b7-4854-9f1b-a45e129e40af","resolution":{"observed_at":"2026-05-18T01:12:13.850376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:48.965498Z","title":"Imagenet large scale visual recognition challenge.International journal of computer vision, 115(3):211–252","venue":null,"work_id":"c1974363-1ae9-4842-81d9-b6c511154685","year":2015},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b1a79799197e13a284df52a8e019f67cb6291fb60dccfa180a820f5794ca3041","observation_id":"b6cc72de-785a-4288-88b9-18fbfb93c248","resolution":{"observed_at":"2026-05-18T01:12:13.856479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294","venue":null,"work_id":"25581cba-8e27-40a4-86eb-c560ee7d7bbd","year":2022},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:7306ea6c87aa24025ef368c0b2b5aea3d0dd1b5ee57cff4baab204802e8b7a56","observation_id":"e6bfb617-6f55-4f8f-864f-092c2fcace0a","resolution":{"observed_at":"2026-05-18T01:12:13.859786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:5057d1091d497d12decdb7015f60f2c420c90308b8bdee057518c992adb3e504","observation_id":"568a6c2d-a24e-466b-9b2c-595419b1dd68","resolution":{"observed_at":"2026-05-18T01:12:13.486509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"97895674-f786-4542-af0e-9f709b38b567","year":2018},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2f88a9758ceea475eb10d85bb075d53ba3565faf7d26ed7070235f896d405ed4","observation_id":"a77e738e-23ee-424b-84aa-9478fe595362","resolution":{"observed_at":"2026-05-18T01:12:13.863114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:11583ad4c17e4c0ffd3e2db9a82c4cb423e49f400fc6535c4621688948c1b843","observation_id":"c854674e-5a63-48a3-904f-c70247a1bd89","resolution":{"observed_at":"2026-05-18T01:12:13.494054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Storygpt-v: Large language models as consistent story vi- sualizers","venue":null,"work_id":"0c9333c2-121e-4a29-b2ab-12e7edd066d1","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:3a0798f771c2690d835f83733dfec3c6667fb0fec2b54ead57d145c22b925322","observation_id":"ed0dd9fe-d810-4cb2-8e57-7ba100a0033d","resolution":{"observed_at":"2026-05-18T01:12:13.866281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:ff1edf34b781fb34c3c15b1a82b354f77b40aacd87f18e2e08bd940c50188e95","observation_id":"eca8cc75-7f27-4bca-857c-4bd97203bca3","resolution":{"observed_at":"2026-05-18T01:12:13.500996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-08-19T22:28:10.405438Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":"2412.02692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable image tokenization with index backpropagation quantization","venue":null,"work_id":"b3f063c5-ab7b-406a-b2cb-5c4a550bde24","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:0820526ca683b82cabc831fd0279e0c5bb9eba39f692671d6708d48693be3211","observation_id":"ae32dae3-3d6b-46d0-a3d7-3906182ad645","resolution":{"observed_at":"2026-05-18T01:12:13.504973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:793a76dcb93bf9e86143293c20a63d72c72b9c1cd9c34607fced8081fa803cd4","observation_id":"c9ba1edb-2354-418b-9c38-f0f87cc495e1","resolution":{"observed_at":"2026-05-18T01:12:13.508411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:aff558c8a326c2f7c99b3c4851d911f0488c74925de3fa94907146146f7dff4f","observation_id":"6970193c-06e6-4feb-84eb-96d084a1ab5f","resolution":{"observed_at":"2026-05-18T01:12:13.512775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-20T01:15:45.865236Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:155b068000536374560c8d0c6c38447c6f7c74fdc4a65d306caae836a9aeb62c","observation_id":"9b4fce4f-03f0-4b94-adbd-7c319f45989b","resolution":{"observed_at":"2026-05-18T01:12:13.516657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.595007Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"b5fd43ff-336f-45fd-933c-ffddf3003880","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:947dd8fcc84d892a4158a07043001702f65d1dc8227898e7f07a67b43aca4984","observation_id":"503ce59f-d8cd-47da-8603-3876000d39f8","resolution":{"observed_at":"2026-05-18T01:12:13.869591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8c89991508ad652cbc2206fba5c6626d4663e05b34e4da217a0cec3ff21eaef3","observation_id":"bd0b1bc5-5322-4bde-a831-09c7f9c3801e","resolution":{"observed_at":"2026-05-18T01:12:13.523756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative multimodal models are in-context learn- ers","venue":null,"work_id":"fdff4679-3a1a-4565-97ee-5ac5b130627a","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:814c61fff8fe630841c39ea222877e7bbf8f22da826dd77bb70369f72479bc2c","observation_id":"2c7aae4d-ae16-4695-b11c-cf66d13c5a91","resolution":{"observed_at":"2026-05-18T01:12:13.872513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"7b3636cd-0060-4ba4-a06f-b3737b79b87f","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:198099bc9c8ac8cb94a927b8bf2643c329a536f7df3dc7e0674e149d9785c048","observation_id":"a74d0875-1b45-4f8f-a7d0-2e3e956c6f00","resolution":{"observed_at":"2026-05-18T01:12:13.875376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:fe6d2ba974961e9f6b5926d658ae220dbc38165e1d58a703927d0cb63edd21df","observation_id":"2a9b32f0-c245-4166-b57e-bd7717d0dc84","resolution":{"observed_at":"2026-05-18T01:12:13.534612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlagScale: A unified meta-framework enabling adaptive heterogeneous computing for the llm ecosystem.https://github.com/FlagOpen/FlagScale","venue":null,"work_id":"7799f10b-8653-4bcc-bd12-36a370a06213","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:db327588e98d1e357e8268c31a418d981981716a77155d31b452beb877588e52","observation_id":"a5c21e30-15af-46d0-a959-379a48b053e4","resolution":{"observed_at":"2026-05-18T01:12:13.892238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5 flash & gemini 2.5 flash image model card.https://storage","venue":null,"work_id":"a3a47a86-036b-4275-9858-68d070a7a9b9","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:390a89417467f8196b056e60672e8c4dd99dd25ec0e7c2e00d12a1e0d030cc7f","observation_id":"0d60490a-40c8-4c67-9ee6-f7fa421402f5","resolution":{"observed_at":"2026-05-18T01:12:13.895266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:3530dea3e8bcfe9f82b2e60d437c8d22eed99e33a5320ed7c2315a8ec3a71a41","observation_id":"cbc2613b-9e37-4c01-8bce-edd438dd9581","resolution":{"observed_at":"2026-05-18T01:12:13.545324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kolors 2.0.https://app.klingai.com/cn/","venue":null,"work_id":"807d382f-d3e1-4368-8f24-186e7858e8cb","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:b23068051e509ee58c82953df8adbaf9669190631a091cdbf180a2a7ceae85de","observation_id":"4bd5cfe4-5161-4574-9f24-851b5a3fe7b3","resolution":{"observed_at":"2026-05-18T01:12:13.897797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"147760e6-3846-4108-a4d9-c0d195bec8a1","year":2020},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:a2171874655e2558537fe83f449dca965a502a4c53a0091f08ae377ec2bd0ae4","observation_id":"2afe1780-1b23-4a20-aeae-8031f00e81a9","resolution":{"observed_at":"2026-05-18T01:12:13.900982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free consistent text-to-image generation.ACM Transactions on Graphics (TOG), 43(4):1– 18","venue":null,"work_id":"60c78e05-66b6-4127-8c98-0fd574568cb5","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:54f6d3306753fcf797305050307f2f278784e312be01d4581d24da842b4cb1eb","observation_id":"92e309a8-d75d-46a5-b963-7013954c790d","resolution":{"observed_at":"2026-05-18T01:12:13.904012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual autoregressive model- ing: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865","venue":null,"work_id":"b731e0a0-2ddf-4c92-a67b-b55caa738c07","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:eaf9d79e7734e7bb02b84c8e356ac6487a1b7508e251be712408b237eefdd2a8","observation_id":"ba33742d-c700-4b24-8781-215ec2284199","resolution":{"observed_at":"2026-05-18T01:12:13.907326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:dd4504653f07013f07f6b9ea3678f2b44676010cff8c570f2987c6605e3f5589","observation_id":"63a4f167-f0c3-4913-8b06-110ecc88c93c","resolution":{"observed_at":"2026-05-18T01:12:13.562571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":"c88c535c-3f06-4fc2-ace3-0b2f029f0153","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:4468ec0c22a98d375e8922b7d56f49a359f13ca9aed35ff9b952996d1f11f292","observation_id":"0878c272-1884-463f-96a2-19246211155a","resolution":{"observed_at":"2026-05-18T01:12:13.910441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.07870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.596474Z","title":"Textatlas5m: A large-scale dataset for dense text image generation","venue":null,"work_id":"976bc5c4-edad-4331-8335-e538f135fe18","year":2025},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:2f8a9563386a40465ea76b5eb8aaeca449c50aa2e95b196184a88309c28f7839","observation_id":"6ff02927-3e71-458c-97da-be03eea707d2","resolution":{"observed_at":"2026-05-18T01:12:13.569579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:8aa8979eb616ace66999d53c479154f437453c300e2ab2188e5d7210ce6ad50f","observation_id":"52937886-7a67-4471-b533-8e1c5411bc4d","resolution":{"observed_at":"2026-05-18T01:12:13.573083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":44,"verified_fuzzy":55},"total_outbound_references":131},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 131 outbound references and 68 inbound Pith citation observations for arXiv:2510.26583."}