{"as_of":"2026-07-23T09:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e63858c218240ae14faec75fb0dbcceb46f482ad975c20c0aa40e6bf78cef3b","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T22:48:36.010306Z","state":"measured"},{"denominator":135,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":135,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T23:27:11.006580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:772d16636b31b448a4882265ee2571178a652f0ea1d21af7505b97839ebfbba5","observation_id":"af558edc-2ffd-4bca-8523-b58fa255b56e","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:0f5d9c386a77637b311b3f5435fbb2a4637dd050c54db51cbc9f9807473a25e2","observation_id":"3165b007-efc1-452e-936e-6e9c286e10b8","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:aa02b125e945852485784e36859a1ce0633f28eeecfe079697963d2378ecd222","observation_id":"ed90ede6-b43a-4b15-b7c9-5a7ef465cf17","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:a001ec494d197483fb45328c67140e09d1164bd560afc838107459cd2fedef0e","observation_id":"7a61c536-71a7-4c96-8e55-34cc6a943e8f","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:b60561b89336b8eba8bdd1c172a4ad0ae11cf8edfe0482f81a5025ef84d46382","observation_id":"e729be8c-ef2d-449d-a6ac-53322fa86115","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:0d0558ea5a17fe874ec73ed562c9b300346ba68e9d4db7243d907ea3c48afaea","observation_id":"6008612e-a5e8-40b7-b1a1-8ec461030bd9","resolution":{"observed_at":"2026-05-16T15:15:46.389849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:8fff303ba208c9962c56957113d8a6295f95a9b680f3920df593f36eb7804f55","observation_id":"996d88c4-aa31-4bd3-94bb-3ffc259875bc","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T23:51:43.934329Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2503.14324"},"observation_digest":"sha256:64355dc2ee5b4265810c9cce54e672c9f6a98789d5d3a0478e3d452d33decd69","observation_id":"1b9ca5c2-4f71-4557-b27c-8b91426a49fe","resolution":{"observed_at":"2026-05-22T23:52:16.705477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-07-06T21:06:17.499947Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T22:49:23.074271Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2504.06256"},"observation_digest":"sha256:f7660377c976fbeb67629ca02a85984893585fe086f569c072209d5bcd79801f","observation_id":"668667c4-8498-4ab8-a7b9-febb1358596b","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:4e7ad1dfd4327bbf03d764179919f93e7990ae5fa57acc14c577a3579858a173","observation_id":"80db5c71-ff3c-4190-8bea-45e63708584f","resolution":{"observed_at":"2026-05-17T07:24:04.830724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T23:34:26.878354Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.09568"},"observation_digest":"sha256:a138350957d5519960df9d86f30215fb143b46761950cb2e69b63284d32ded5d","observation_id":"0b81f27f-e350-4f6c-9973-97ab9502ee8f","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:c4bf50cb679fefb2c1df8b356e387501ca8bacd0390f9d59e76fe8f92207fe11","observation_id":"5df88eea-3a06-4e4f-b44c-fdd6d3ac50fc","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:a964255e78aa8401d9fdc1b139a3382b4bc6e9844e86ba93ff3a57df62c8733f","observation_id":"9e61143c-38eb-40b6-b20d-e5576defed9b","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T12:59:31.454155Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.23606"},"observation_digest":"sha256:3dc143d731344fd524f904cae2b2db32fc7bb5409289350c933114cf8f8ef65f","observation_id":"1ebc921e-d029-4c36-b1cd-37b297e82e6d","resolution":{"observed_at":"2026-05-19T13:02:18.308312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:a732ea20b4e97ab8647f13d3ded38af3abad9b78267bd95083595c36748e7bdc","observation_id":"a89247d1-c35f-4a8c-91b2-18ae455e6903","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:feb7fb09cacc08dd1c1f574796c9fe3c261055658bbac151412d09867956c396","observation_id":"e7632258-6148-4d21-ac0f-65e9f6a650bc","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:bfff2c75678e04ea7caf12576fa29415c5d210c04f5f059bce5e9c732caca55f","observation_id":"5ee365ae-f6e6-4c2b-8c9c-dbd8c72cf1b5","resolution":{"observed_at":"2026-05-18T14:16:27.761609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2510.21122","last_updated":"2026-04-07T14:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-24T03:23:34Z","title":"NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T04:39:58.296388Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2510.21122"},"observation_digest":"sha256:703967d74bd9bccadffe7c404ea83426bb463d2aa5139a0a02df4d306bfa40f5","observation_id":"3ac0cb6c-f1b0-4d31-bacf-0f2a9925d788","resolution":{"observed_at":"2026-05-18T04:40:52.996483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T01:12:13.426640Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2510.26583"},"observation_digest":"sha256:9041f32453632528b25d8b37c18b9a60b0c33f7bbe36d097a73e6e5153cb5ab1","observation_id":"1006dae3-4b1b-47cf-856a-808dbe738fe7","resolution":{"observed_at":"2026-05-18T01:12:13.566047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2511.08480","last_updated":"2026-04-20T04:37:07Z","snapshot_observed_at":"2026-07-06T22:35:31.750339Z","submitted_at":"2025-11-11T17:23:02Z","title":"Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T23:28:29.990439Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2511.08480"},"observation_digest":"sha256:e8a531f57d2530568d7bd3a5b52b8ea2af0f5dd0704c4b7bafd3edda3c108623","observation_id":"e5f5773b-b60d-4e00-868a-1e9e6091e955","resolution":{"observed_at":"2026-05-17T23:30:29.298415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2512.00993","last_updated":"2026-04-21T07:01:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-30T17:26:47Z","title":"PhotoFramer: Multi-modal Image Composition Instruction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T02:47:17.132901Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2512.00993"},"observation_digest":"sha256:45adbe36517bc9508c41e80b859950c01b46b36b61c8637774a6ef8a3ff2dd8a","observation_id":"5b1c25de-306b-4a98-b4b4-5e64c9c0ed85","resolution":{"observed_at":"2026-05-17T02:48:54.141472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2601.01593","last_updated":"2026-05-18T03:12:58Z","snapshot_observed_at":"2026-07-06T22:40:41.626783Z","submitted_at":"2026-01-04T16:46:13Z","title":"Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T16:57:09.843691Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2601.01593"},"observation_digest":"sha256:b02ed12d0e6c513f2f2392cf2ef59134aee8329dd0b4f3edd4b6e3499f82cffa","observation_id":"1ca496ae-f87f-4c2d-999c-2cbf99369983","resolution":{"observed_at":"2026-05-21T17:00:24.158137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2601.15507","last_updated":"2026-05-08T04:00:14Z","snapshot_observed_at":"2026-07-06T22:42:36.961014Z","submitted_at":"2026-01-21T22:29:33Z","title":"A Unified and Controllable Framework for Layered Image Generation with Visual Effects","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T11:54:46.989748Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2601.15507"},"observation_digest":"sha256:cd16a8a63ed827c69528c7a6fc8fed12e536c3c3abea751373d76d1d8652d000","observation_id":"1507d451-6c64-4060-83a8-7e65a2f61f93","resolution":{"observed_at":"2026-05-16T11:57:50.227408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:53669ddd12380f26fe174d0b57ec2d528e44684a0cc19b1adb526681d332ffc1","observation_id":"a25013c4-f88f-471b-9601-2cdd175ca9a5","resolution":{"observed_at":"2026-05-21T14:50:14.885074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-05-26T06:31:40Z","snapshot_observed_at":"2026-07-13T23:27:05.332450Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:ff596851d2bbeca37061753b0de2b768eb09098da227a33981b1453906a627ae","observation_id":"fb2470f3-e6f4-41b8-8319-a2c6a8855a32","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2604.07422","last_updated":"2026-04-08T15:37:42Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T15:37:42Z","title":"Multimodal Large Language Models for Multi-Subject In-Context Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:48.034771Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2604.07422"},"observation_digest":"sha256:0d68eb08c0409f1a73015020bab562c5bfdbfe76d2ea8e8a0e878625b0a33bba","observation_id":"27898b14-4655-450f-84a8-98c00a7dfc22","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2604.21926","last_updated":"2026-04-23T17:59:16Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:59:16Z","title":"Seeing Without Eyes: 4D Human-Scene Understanding from Wearable IMUs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T21:59:00.442135Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2604.21926"},"observation_digest":"sha256:7779802bd703e9c3b393df485f92a61e908766c2f14d7c0b3f2eb749e95a2032","observation_id":"6f411d50-8d74-4e68-99a2-d987c7e8712a","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2604.25636","last_updated":"2026-04-28T13:36:03Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T13:36:03Z","title":"Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:55:19.763050Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2604.25636"},"observation_digest":"sha256:1d15d940eb43551a65401452c771e9f309fa65ed139cfe34fcdd99a85a9a0182","observation_id":"886bb0bb-19dd-4f22-892b-51eb27cde6d6","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-07-06T23:18:12.631820Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:db580c6b30f727648938e8136e1a554a89e4ed295714a3dd97a3a5e6fbb1703d","observation_id":"d3041dea-be74-4ef7-a95c-2e5be022f222","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.05781","last_updated":"2026-05-07T07:20:04Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:20:04Z","title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:22.805268Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.05781"},"observation_digest":"sha256:f44960eeccfe67fddf9fd50cf6307201e3f5fb472efe754c3584c1973985fe15","observation_id":"1d2bbd97-d671-4132-98c7-b617d66971a7","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:1920783e5209877a42dac136f9ed8798c939af5f122e4ec1ab10983b83a3b831","observation_id":"ea04040f-fb56-4c54-9a00-b72e7a0b557e","resolution":{"observed_at":"2026-05-15T22:48:36.519178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.15735","last_updated":"2026-05-18T07:08:58Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T08:45:37Z","title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T19:24:57.339949Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.15735"},"observation_digest":"sha256:a2f854188f7b856818e6f8ae7de7bbb3ab9c72caf6fa30f486d1617130e03b1a","observation_id":"961fbf2a-c2b0-4aa9-b402-fe4c83154736","resolution":{"observed_at":"2026-05-20T19:28:55.075857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.15792","last_updated":"2026-05-15T09:48:46Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:48:46Z","title":"Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T18:44:54.835575Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.15792"},"observation_digest":"sha256:e1e0099558a9d8b945207e310521cab7d5ed3a2a01c3be15da55a63275ed1d8a","observation_id":"ee7109fd-2f23-4254-a189-e3225df7303e","resolution":{"observed_at":"2026-05-20T18:48:53.487206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.16961","last_updated":"2026-05-16T12:23:20Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T12:23:20Z","title":"Latent Action Control for Reasoning-Guided Unified Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T20:40:24.193206Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.16961"},"observation_digest":"sha256:768f1410395fbc579065ded7e1502cc57c79e5f541562729090418dcf14de02d","observation_id":"da0539e2-782e-4742-9aed-fdf3c627fa13","resolution":{"observed_at":"2026-05-19T20:42:46.310819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18052","last_updated":"2026-05-18T08:41:10Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:10Z","title":"Efficient 3D Content Reconstruction and Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T11:38:48.194538Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18052"},"observation_digest":"sha256:4411e0cd299ab42ea1e7e82689c7deb6a78d33e3dcaa32079e7d614f9383ef69","observation_id":"c8bb84f1-4506-4ab7-8a4a-d74792420580","resolution":{"observed_at":"2026-05-20T11:43:14.795406Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:728ec4fd32a04b857bdcd7cda900121bf7fe7f153db536805b877882496e94ce","observation_id":"ba219610-a0b3-46cf-9511-34c5ddccae2d","resolution":{"observed_at":"2026-05-20T12:08:15.866309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9c3855a2684a5893c77ed9fe840457984d8057087024eea6c819f76803224a4b","observation_id":"6080c043-558d-4086-b4b9-8e649929ff9f","resolution":{"observed_at":"2026-05-20T11:48:14.967321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7be9ac0fb758c7d177e08338efeb0785fb8e5858950f9570a6611d2de19df742","observation_id":"1edc4828-c9a1-4244-acf0-7d70a78b3698","resolution":{"observed_at":"2026-05-21T07:59:50.734734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:85f9a08585dc4a4a2e252ab9dcbaf1317f54c421df3473c225e670850cd9656b","observation_id":"d9f17284-5777-4f83-bf4f-0a19b631b815","resolution":{"observed_at":"2026-05-20T11:33:14.182157Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:c2a370ae696bdd56f71587a41eb7dfb123d3a9f77bbfb777bdff0061997bc6b0","observation_id":"0c937d14-e652-4430-8229-1401fa97dec9","resolution":{"observed_at":"2026-06-30T18:35:00.298289Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.19227","last_updated":"2026-05-19T00:55:18Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:55:18Z","title":"Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:46.236860Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.19227"},"observation_digest":"sha256:bf0ad23051adfdb4ac17f48af72df8d1119e20be6e6b483d360523679930965f","observation_id":"e51c65c4-d0b6-47eb-9861-2f85679d0b74","resolution":{"observed_at":"2026-05-20T05:38:05.430591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:0c483bb0b3f314169752ad057ea07ca51d03896135fdabac98927a7a9991d38a","observation_id":"8c20e9a7-de9b-45dd-9550-91fbc35ba287","resolution":{"observed_at":"2026-05-22T06:41:10.393507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.25328","last_updated":"2026-05-25T01:17:32Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:17:32Z","title":"DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:08:57.793923Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.25328"},"observation_digest":"sha256:ce81f1f15bde9b24425443d07925aebc2a8b187c34e6e20cf6b5ff9dd67d4e8a","observation_id":"2db399f9-4eda-4910-afee-1b94eb91a7ed","resolution":{"observed_at":"2026-06-29T23:14:01.756615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.29591","last_updated":"2026-05-28T08:33:43Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T08:33:43Z","title":"Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T07:41:53.678423Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.29591"},"observation_digest":"sha256:b07f14b9c043e2a1933f1af3d72023e8aacc85303ed6dcc46e900dfbbbbcddea","observation_id":"da75be86-2cae-4d43-896f-9db8d052c593","resolution":{"observed_at":"2026-06-29T07:43:13.423501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.29948","last_updated":"2026-06-01T07:03:07Z","snapshot_observed_at":"2026-07-06T23:39:20.085961Z","submitted_at":"2026-05-28T13:55:19Z","title":"HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:54:46.741498Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.29948"},"observation_digest":"sha256:6d24ee4cd4c6024c07fd429838550ee07dee12663b4e46cc02b86e5d35dffd78","observation_id":"fbf04c82-9eba-488e-8110-4be9ce738958","resolution":{"observed_at":"2026-06-29T06:03:08.853598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:7a86a600f3671d29810d4653637ead34a6d3fed54aa3fe5b041384fbc9dcaaeb","observation_id":"ce3c2e53-7d9f-44f7-bf88-a53cfb71b336","resolution":{"observed_at":"2026-07-01T19:16:00.539420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-07-12T15:31:56.990570Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:54:10.460872Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:0f5dfc8b736aaca8caf99b115ae6f744faaf35916405a0234f2a47d9e93bd22d","observation_id":"6bb3d98e-973b-4f73-b358-c0724bb10b90","resolution":{"observed_at":"2026-07-01T19:16:00.906524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"SEED-X: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-07-12T15:31:56.990570Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:795262594de5aca523b6e8de22c7eb1350340fd918028d11ac7bf1f049c73cec","observation_id":"ac8fcb53-ab2b-476c-bab2-ffa7d099b020","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.04457","last_updated":"2026-06-03T05:01:36Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T05:01:36Z","title":"Imagine Before You Draw: Visual Prompt Engineering for Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T07:12:24.297839Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.04457"},"observation_digest":"sha256:007062cd2270d29ebd8a805924a4ac8bfcc5184c2c3156362e10b7ad8fca6e69","observation_id":"1cba8a15-5d9a-454b-8e1d-b6c22e7b9116","resolution":{"observed_at":"2026-07-02T07:06:43.979859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.11188","last_updated":"2026-06-09T17:59:28Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:28Z","title":"ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:29:11.526106Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.11188"},"observation_digest":"sha256:47cc114f86019a679c297aa9ff66ff9730b2a8e282750e37168df5c8be31baec","observation_id":"38b6cc66-aaa1-4e34-90fe-9cd1cdd76166","resolution":{"observed_at":"2026-07-03T04:57:38.738989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:fb4ae7f63f10e46483b7ca69a77b95fb70bee60040511e6f1fbd01fa4711e078","observation_id":"369161e1-2344-4e56-94ad-4e4be1e86c76","resolution":{"observed_at":"2026-07-03T14:28:32.112494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:25.661515Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:7b1bc563617671d1919eeba85c21624e6037a941d220f1d383a36e91d53c596c","observation_id":"c05a8e80-b529-41d6-9db0-df895d156b93","resolution":{"observed_at":"2026-07-04T10:09:44.685113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:b7bf18ccc439c20e573bf88fcc44a55a9b18328b6f5f6787976b7a8d2469d412","observation_id":"95b3cfab-67a0-4069-bdcc-260fb0c4ea64","resolution":{"observed_at":"2026-07-03T23:19:02.514494Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.24441","last_updated":"2026-06-23T11:19:34Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T11:19:34Z","title":"S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T00:20:42.801659Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.24441"},"observation_digest":"sha256:4bff6fa1e663a5218898239bee20ed00814b8058c58a7d5a9d329ef371ec7d0b","observation_id":"0f62f5bf-e39a-4bfe-949c-039b3c7f7994","resolution":{"observed_at":"2026-07-04T16:39:58.056816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.26984","last_updated":"2026-06-25T12:58:54Z","snapshot_observed_at":"2026-07-07T00:01:15.803410Z","submitted_at":"2026-06-25T12:58:54Z","title":"Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:44.939060Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.26984"},"observation_digest":"sha256:365074a72fff77b1bc34fb5d42415a97059ba134e8cc65cf8f36df2ad5816a84","observation_id":"a426cef9-93c5-40c1-8a0a-1fe2a45a1efc","resolution":{"observed_at":"2026-07-04T13:19:51.166416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:2b2c2313286563f7cbdba3915109bbe576f9c8c58044be980e890b886bfd9278","observation_id":"23f24c22-2ef5-4b20-856e-95c98f14eaf4","resolution":{"observed_at":"2026-07-04T13:39:51.501196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.28696","last_updated":"2026-06-27T02:43:13Z","snapshot_observed_at":"2026-07-07T00:02:43.396508Z","submitted_at":"2026-06-27T02:43:13Z","title":"COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T10:10:59.772213Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.28696"},"observation_digest":"sha256:4cd96f33d6ac61a712eb402c610753832e30b580b329b3438acd7876866cf2e8","observation_id":"71f8bf08-8832-42f0-b87d-71b7cf5ed3d2","resolution":{"observed_at":"2026-06-30T10:14:36.408928Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:766bd310a7efc894e35c6437e636423edce8de31c03506efd95c93159a42271a","observation_id":"255b34a9-50f8-4009-86ce-ebe2d0f620d8","resolution":{"observed_at":"2026-07-01T09:55:41.640441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-11T19:17:19.634242Z","title":"arXiv preprint arXiv:2404.14396 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04423","last_updated":"2026-07-07T07:27:22Z","snapshot_observed_at":"2026-07-11T19:17:18.789624Z","submitted_at":"2026-07-05T17:33:59Z","title":"Transferability Between Understanding and Generation in Unified Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:19.634242Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2607.04423"},"observation_digest":"sha256:1368860dca1248f6f8f4abef330632d6d775a87ca7593bd9dacad28979eb8cb8","observation_id":"7d9ec4ea-4c7f-4096-bc43-e6b828d6c7d3","resolution":{"observed_at":"2026-07-11T19:17:19.634242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.14396/citation-record","integrity":"/paper/2404.14396/integrity","json":"/paper/2404.14396/citation-record.json","paper":"/paper/2404.14396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0717b0f5-1407-4005-9f21-4e2907f265d7","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:cb45c3a926b7103fd1492889cbac80e6fd92e34e2395c19c14e19169d917f6f9","observation_id":"06646450-57a3-40e5-a1ba-fc05cd094355","resolution":{"observed_at":"2026-05-15T22:48:36.517845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:93ac0c6c4c80a2b4ee70f6b0578a568790654d6146df0720004fae94d2da56a4","observation_id":"a88d1fe9-d83b-4ce1-adea-f79b57ca07c8","resolution":{"observed_at":"2026-05-15T22:48:36.314373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-10T11:17:03.636249Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:ead66664af43e77e016c695344e16f5c1d28175fcee04f2718437aec1e5d06fb","observation_id":"b01f9312-c7bb-402e-8579-9ba1b9433960","resolution":{"observed_at":"2026-05-15T22:48:36.238630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-07-10T06:36:52.542747Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:93fc0fa766d88e093369b301665b764c587df19ed6096d9031d88f1e0fb7f79f","observation_id":"8c03f0f6-034c-437c-8558-4c13363e3636","resolution":{"observed_at":"2026-05-15T22:48:36.243987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:6c17b22472b7707f8613a63b3f615de478e7d44dcec9838a51b868b38b89280d","observation_id":"b7fa232e-b22f-4de7-831d-45758dd4e37a","resolution":{"observed_at":"2026-05-15T22:48:36.249969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:dd7d00404fd8167e7ce0327d73ac5fb3530ab903e72c881961d04702d058561f","observation_id":"a5adf454-1554-496a-bb9b-c37dfde466cd","resolution":{"observed_at":"2026-05-15T22:48:36.255545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:63544ea323affac683dda7a5953c91f4b8468b720bc6e0ab7b9c16e7f20555f0","observation_id":"7d393e68-5f8b-46e1-81f5-3e0696907aba","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07575","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-07-04T06:39:37.554183Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","venue":"cs.CV","work_id":"38f258e4-8974-4ea0-98a8-a336838dcfaa","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:91dbf1f282c04ce8486b92e744e490bd7d883077d82f911661e8af42c5a48ace","observation_id":"015d0c27-6c95-4e1f-801b-cabae4b5f28c","resolution":{"observed_at":"2026-05-17T03:03:27.047113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:d7849e28462730ae3b57c9e5a7287c1273ea2944aacb16cff7b39144906936f6","observation_id":"a56d3948-79e7-4173-a1cd-a95cbf176817","resolution":{"observed_at":"2026-05-15T22:48:36.307750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:41.000069+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:41.000069+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.117928Z","title":"Language models are few-shot learners","venue":null,"work_id":"04bc68bc-b7df-4ec1-8599-da037bd4f085","year":1901},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:0152fef58185a605573515ef42086b12b3644f27c852e3244512de2909cd12fe","observation_id":"9033b1b9-4bca-4f1e-9fc7-666958ca0ef7","resolution":{"observed_at":"2026-05-15T22:48:36.405712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:31cc4ca602fc667d074ce9983cd0bd6efbba12cedbd585556f54e470cc5edf24","observation_id":"6f45a138-35e6-4501-b9ae-2e21997824f7","resolution":{"observed_at":"2026-05-15T22:48:36.320197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-07-06T16:14:56.479402Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2309.02591","doi":"10.48550/arxiv.2309.02591","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":"5d883697-5d3c-4d0c-a56a-59076ccd0ae0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:6dcaf1c435a3bb539cbd82edc339ef1eb5550ea292d4a51f5cdca41cd446d8d0","observation_id":"2e63b695-acb3-402b-8270-6b1634298980","resolution":{"observed_at":"2026-05-15T22:48:36.344214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-07-06T15:54:32.519590Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":"2307.08041","doi":"10.48550/arxiv.2307.08041","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Planting a","venue":null,"work_id":"a97ecc74-b2ab-4837-bdc1-0a385272b7e9","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:950a1f5965eb061e8a4ed9bc0975805619b914de483dce673025a787203e5610","observation_id":"8bc9297e-4349-43c7-891b-fde40426852c","resolution":{"observed_at":"2026-05-15T22:48:36.350446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-07-06T16:26:30.291083Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":"2310.01218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-07-09T20:16:29.588718Z","title":"Making llama see and draw with seed tokenizer","venue":"cs.CV","work_id":"9453feaf-a19d-4603-b9de-da50593c5d43","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:22d352285a3fccf10c46a518b008e3fd8526e4eab89f03e3dc13041f59c6b710","observation_id":"5892f0c8-53f8-4454-b1e4-d0210078372b","resolution":{"observed_at":"2026-05-15T22:48:36.390334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:cd5a3cb13d0d9749af9ae781b67affd04934b00d9cc26517ea3b2ba52a5c3e2e","observation_id":"e5c12442-09ba-4f99-bac4-d47f90977f29","resolution":{"observed_at":"2026-05-15T22:48:36.396242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":"2307.05222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-04T10:09:44.721463Z","title":"Emu: Generative Pretraining in Multimodality","venue":"cs.CV","work_id":"d20ff802-68ef-4783-943f-7bf17acb6a68","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:34aedf72a51c302c7d624f4b5b242fa33f5d90cdf99ac327063a1b12266024c3","observation_id":"74006cb6-215a-437c-9783-f0cca1e050b1","resolution":{"observed_at":"2026-05-16T20:22:11.462164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2312.09251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language understanding and generation","venue":null,"work_id":"2891128c-bc6e-4651-be44-a7b8f6f3ad91","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:901757ee59585faf11eb4133d1589c95c8d1d46a91df76ecc250738447fe2036","observation_id":"5928f9cd-bb60-4b94-a0f9-ed2f6486b02a","resolution":{"observed_at":"2026-05-15T22:48:36.089738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2309.04669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.854434Z","title":"Unified language-vision pretraining in llm with dynamic discrete visual tokenization","venue":null,"work_id":"30af28b4-c35b-40c0-acbf-085b0d588bfa","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f039c1cdcbb60929b15f4598400691f01af22ef53ed8639f08848ab2530e6558","observation_id":"0553bf35-5606-48f9-810e-db61f4da055c","resolution":{"observed_at":"2026-05-15T22:48:36.097082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":"2312.17172","doi":"10.48550/arxiv.2312.17172","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":"dee0bd36-ce7b-427c-9af3-0ea894c01777","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:96f3ed2f46a73609800a15dc6db06e3efc9b03ea061610a36080cb5e6255e346","observation_id":"5eecd7f3-3e5e-47de-9c20-db37a670b5de","resolution":{"observed_at":"2026-05-15T22:48:36.134116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-10T07:36:58.000502Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:1111ea082762200111e04e4185a486ce944d49531fcc80355b6b5c30452ab26f","observation_id":"a658131c-7173-4ea8-9e77-352975f56394","resolution":{"observed_at":"2026-05-15T22:48:36.176856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f2bd7eda7bf04deaff1632584697670d0461e69ce0781dab2bba56d260ca9c6e","observation_id":"506a67fb-5674-4a18-aa7c-6388d08e283d","resolution":{"observed_at":"2026-05-15T22:48:36.183449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-07-06T19:11:40.618767Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:d61c8baf762bd55e410183531d2cd406cde65fc15b944cc54983dabde51775df","observation_id":"a8ad1402-92db-4cad-96af-84fe356dfad0","resolution":{"observed_at":"2026-05-16T00:26:21.484895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-07-06T17:06:08.967869Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":"2312.13286","doi":"10.48550/arxiv.2312.13286","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":"a80a95eb-a4c1-4074-b835-c862cc4bd0ce","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:d4f52f96f3451998d94aa14d61fc81c2fa6423d03f878bac35b9586cb6074a4f","observation_id":"c634f635-b37b-4346-92e7-85eb92dcf127","resolution":{"observed_at":"2026-05-15T22:48:36.198403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:8a3a99b7e2cb8e2b9e19e049222d722335577238044794bf7da87d497fbd5ae8","observation_id":"e098809f-8695-4d67-9a8b-fff5399b7420","resolution":{"observed_at":"2026-05-15T22:48:36.232825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"475ed389-b9d3-4059-b7fe-a417c946ea14","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:8ebb6c7f81428c669731d94a4a4a99be2693c8fc6c3a7d17dff2f83071a387ea","observation_id":"bd2014ce-35f7-4c23-a530-fe8f57628cfc","resolution":{"observed_at":"2026-05-15T22:48:36.410192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-aesthetics","venue":null,"work_id":"416bb26b-f08d-4745-a683-8727f5e103f1","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f7b3b03596d9b6f7f3a8ff116d33bc9b431fcf05dcdc5c666c4142afed2091c8","observation_id":"35f45ebf-0960-4c04-9201-e38e0c2b75a6","resolution":{"observed_at":"2026-05-15T22:48:36.414232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsplash.https://github.com/unsplash/datasets","venue":null,"work_id":"bc2e2891-0c38-45fa-9028-93cb1a6a3dc6","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:58169351e9ac1d06a2b7d464d5de078e9d0f39157b357bd73424f277d3a52279","observation_id":"e7ba0377-32e9-48b4-a6f6-588c596e92db","resolution":{"observed_at":"2026-05-15T22:48:36.418645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"99be2a10-f4cd-4484-8f98-c8ada4818dc1","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:529615c5cc9c1bbc97f7c5ab32cc57e5f6eecdcb7bd9dd30697cfb664c8d8594","observation_id":"ed9be8e9-fbf0-45c7-81ac-b85ead68ff1e","resolution":{"observed_at":"2026-05-15T22:48:36.423586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"0e06497a-be4c-4f15-bd2a-d2007dec6596","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:88d96b709a66fbdf2610bf12107b5baeece0d143976c9819a99a621c502b0588","observation_id":"72f4aa01-c45b-4c85-a663-54541dad49c9","resolution":{"observed_at":"2026-05-15T22:48:36.427735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10012","last_updated":"2024-05-15T18:20:28Z","snapshot_observed_at":"2026-07-06T15:43:35.260552Z","submitted_at":"2023-06-16T17:58:58Z","title":"MagicBrush: A Manually Annotated Dataset for Instruction-Guided Image Editing","version":3},"cited_work":{"arxiv_id":"2306.10012","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.10012","snapshot_observed_at":"2026-07-04T19:50:10.184264Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.ArXiv, abs/2306.10012","venue":null,"work_id":"283cd9a9-e971-494f-b772-7c29be5a014d","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.10012","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:50017f379c0d207fb57df13ffa219a2a0879ad4c5ee65379844547b13caf9938","observation_id":"482d020a-74fd-4b02-b1e5-6bb2405a2bb3","resolution":{"observed_at":"2026-05-15T22:48:36.268898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-07-10T13:27:05.577162Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:cef2603627b111dd6889490ba32983e272014b36d35c81fd3083599e97633de8","observation_id":"2d8e3930-b40b-40cc-8a51-14a1528b2da5","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:e6f62a0a875cd8ab606bf6c80d96152797f0db367390cf5b737f3a85f48dc082","observation_id":"1503c723-328b-4cac-a9aa-56a377499b70","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-07-06T17:11:38.571578Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:5801de4438dab6f9c756ca1556c88e56635d240afc06074b997a416cb1b0ae86","observation_id":"e83d3dbb-328f-4248-b67d-2a7d1d376388","resolution":{"observed_at":"2026-05-15T22:48:36.288113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36","venue":null,"work_id":"6b8567d5-b75b-45d9-975c-f0d4ac96a3da","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:4cd695d027d996a964aab152da9abc9e7f736e9e692a84a2d9e1bf682b8a3c4c","observation_id":"9b25c73e-bc96-4093-8b87-0189386dc234","resolution":{"observed_at":"2026-05-15T22:48:36.431427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1fac9240-d18f-4679-b581-af0c3f4df1fe","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:1ab4edb5925010a56b7bbfa39c9e1f105981250a8ba3cfe52a1eb7d0ff56c0f1","observation_id":"673359e7-1668-4fe3-84ec-24d81d051f48","resolution":{"observed_at":"2026-05-15T22:48:36.436051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a67353e0-6103-4875-87ce-e221ba375a25","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:0a179277f94f30f06a6f575d4b3c45245f02566605369d5054328c1ceb7041c5","observation_id":"df6a0842-e4ea-4bba-8339-192750ae966d","resolution":{"observed_at":"2026-05-15T22:48:36.441499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model","venue":null,"work_id":"6403bcc3-4110-4ba3-9bb5-50981502f107","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:3084e363382d48497548b85d6a7c6a78a0754bbd7e687ed1072e2ad8e78c4452","observation_id":"dce19d43-e41c-42d4-9433-d036379eff7f","resolution":{"observed_at":"2026-05-15T22:48:36.445849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-07-06T16:16:56.609388Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:17eb5794dc873b10fd1f13544177d55e8f3562ede60ba6fa6e5b65440ef583cf","observation_id":"45692325-04a1-46af-8fe8-1c6a85e747e7","resolution":{"observed_at":"2026-05-15T22:48:36.326697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:8abd28498da542c1903002a582498cfa038b0baa56f5c663c77397104180db31","observation_id":"e3610478-2f46-4b40-ac3c-b827a681a245","resolution":{"observed_at":"2026-05-15T22:48:36.332414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":"2402.08268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-07-04T10:59:46.566942Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","venue":"cs.LG","work_id":"162054d2-6f8e-4dc0-87b8-ebff78210c7c","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:2d1abef245ad830eceda33ce114d31d0f0a27ec0f2ed62987a3161fd1d4d5b2d","observation_id":"13b707ed-8d25-42dd-952b-75b5dbe8d7bc","resolution":{"observed_at":"2026-05-16T06:36:57.375169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"2913136b-83ed-45a1-bc3b-0d6d8be6e866","year":2017},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:6d53c568ce75b91d7887a0348a4d9eb535b655b5604fac7943a3fa1e6fb009e3","observation_id":"93b02ed7-4c0a-4e91-aa07-e09633bee210","resolution":{"observed_at":"2026-05-15T22:48:36.450583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.822401Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"e114d408-7f00-41ea-98b0-9e628094fec0","year":2019},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:5edc6c58e0a79a2e549881c31262fc7565b7ea3de92194cc0dcef9e98d50ff01","observation_id":"4a8df759-6ff7-4745-ae8a-aca82ab236c2","resolution":{"observed_at":"2026-05-15T22:48:36.456069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:84a14575b1ff73a2cc52e367d404661ca345b85ca1b5a161651f1717f24eec79","observation_id":"64a8b777-a8d6-4d87-8713-51ac7c717555","resolution":{"observed_at":"2026-05-15T22:48:36.357350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:47cbd54cac957d7e02cbd8c9358ce82870182e7c813f5e67a65b97ed7f98bd74","observation_id":"bb2a1794-c043-4d4c-8c57-6cadb8754397","resolution":{"observed_at":"2026-05-15T22:48:36.363433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:74a9def7ef4ca12eb10b7589d2e9d0c8e376c0ed005a3a258bc475927840b819","observation_id":"cfa3d2a2-769e-4738-9082-f3f7d40b892e","resolution":{"observed_at":"2026-05-15T22:48:36.371997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:1015e6f686d1486822b508e34ac2f1c17ac84158f0b03f3a43668264f56d6c86","observation_id":"de3479ee-3811-454e-8dd0-d393e6d94509","resolution":{"observed_at":"2026-05-15T22:48:36.378297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-07-06T16:02:39.154387Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:ba6f0573d7dd43e0e29707a259c0e09420262fdc12e60f074ef0270708af59c7","observation_id":"2bb75d63-3f76-43ff-9750-6617f74cb9c6","resolution":{"observed_at":"2026-05-15T22:48:36.383823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"5cb789f5-9d01-47bb-9061-c1bdfbb7cefc","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:526ad4731d3bf50377c0be9471ce04f35c45953a1007371f03628049c354f106","observation_id":"659e8c74-50f3-4375-b65c-53d6c6488921","resolution":{"observed_at":"2026-05-15T22:48:36.460456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"113e56e5-dd1a-4045-8ba5-fcae1141ef20","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:8d5632129e5fc4eeccb63ae735ade2f7fca7a461e59e1acce6a77230536f18c0","observation_id":"c0599be9-a209-441c-a6de-000979333184","resolution":{"observed_at":"2026-05-15T22:48:36.464704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.405511Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4055c382-1505-417a-a4bf-813919c20dc1","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:46923b70f4ed7d1c6921f70bae56b86c8d756ccbd87884dca4dea5bdce54cb26","observation_id":"eea66dd9-b1eb-452e-9aee-a503c8be3793","resolution":{"observed_at":"2026-05-15T22:48:36.468614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:3bb2786e31056db1f1547780c640ab0aa45b234e6de4c300000f8bd534ad6aa8","observation_id":"a27eb339-2fbc-4d77-85af-ce5188773c41","resolution":{"observed_at":"2026-05-15T22:48:36.064695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-10T15:47:23.275572Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:57d18ff3c90b2667e87ab19a0ba472273c129ef23616b51b0148275b02ad75d1","observation_id":"87d3e5d0-daa7-4bdb-a032-fe7e59175f5e","resolution":{"observed_at":"2026-05-15T22:48:36.071790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":"2403.18814","doi":"10.48550/arxiv.2403.18814","metadata_source":"pith","pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":"cs.CV","work_id":"70d699a8-f265-4862-b60f-3b62ca85f6d8","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:3463e8bde0418b3c4557c568ebd270542cf7c188ad78ec759d1038ff78e85fa2","observation_id":"0cf2a487-696b-4933-bdfb-8290ac8bdb2e","resolution":{"observed_at":"2026-05-17T07:44:47.683285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"3c45d468-d956-4bc2-a501-eac137543999","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:864d572ba52f8f6c47418a064d7ab6ed67f79a3062382f19979eb92800458600","observation_id":"596c341e-081b-42b4-a61e-3ce2fd168ae1","resolution":{"observed_at":"2026-05-15T22:48:36.473373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"dfa3506c-bc93-444c-9ea3-09240fbca097","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:c6d56aaa0a5210b414652ff24c158fc386b847cedc3e5f589027f9b3a3880c9b","observation_id":"a7e5ca9b-527e-46bc-ab5b-721673de2d3f","resolution":{"observed_at":"2026-05-15T22:48:36.477021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00716","last_updated":"2023-10-28T11:46:07Z","snapshot_observed_at":"2026-07-06T15:49:27.454558Z","submitted_at":"2023-07-03T02:39:08Z","title":"JourneyDB: A Benchmark for Generative Image Understanding","version":2},"cited_work":{"arxiv_id":"2307.00716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00716","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"d2f811d0-0fd9-42c5-a611-b08454f9ab68","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2307.00716","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:32410c94fc8d31003b0b2209a50d3d943b6542d7eab941a66a6fb594295a0452","observation_id":"87bc44b6-3402-4881-b296-bfb465960347","resolution":{"observed_at":"2026-05-15T22:48:36.104359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:1813f02bd75c80c797a0e1d84272b32e4c51219914acd6789d0defb127a1a36c","observation_id":"2b097277-fe44-431b-a487-4ff794e18289","resolution":{"observed_at":"2026-05-15T22:48:36.115040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06939","last_updated":"2023-10-28T04:19:41Z","snapshot_observed_at":"2026-07-06T15:15:39.104303Z","submitted_at":"2023-04-14T06:17:46Z","title":"Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":"2304.06939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06939","snapshot_observed_at":"2026-07-01T22:26:17.900939Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"fc67e4a1-354a-4784-ac5b-f4d2f4f815d4","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2304.06939","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:637c4106a0a4a26d657b972c46b5866fb70369c2f559887d30f4d962882fb980","observation_id":"e5128dea-3a0d-4b63-83f8-af056b50585b","resolution":{"observed_at":"2026-05-15T22:48:36.123983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":"178654a8-051e-4f64-84cd-66f1e1ec02b7","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:88840bd0e8300a9bfe34577da4f700cfc8a5a9a8a5bebf8fde36a9a32a4d5bbc","observation_id":"b22bafb0-746f-4e69-a1c6-0046a1a6ea41","resolution":{"observed_at":"2026-05-15T22:48:36.481251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:3ff235c068ac6752b0179fb1bb216f24a027b913243309ce8227e832ce04945c","observation_id":"4601faea-8b85-4b1b-873e-642b775c16ae","resolution":{"observed_at":"2026-05-15T22:48:36.141976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":"2306.17107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-07-04T15:39:56.491911Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":"dd29277b-f960-4169-9950-f29ae3062657","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:fdb8d9e6b518bf0a7e3bafdf8ec93cd6447e7d54e96efdc11e3cb4f4f61d74f9","observation_id":"40490174-7897-4290-ba07-fe31d5bcba88","resolution":{"observed_at":"2026-05-15T22:48:36.149695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2306.05425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-07-04T19:20:06.537902Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":"17b44aec-3833-47e1-8d2e-e1080a403019","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:aefbf19fcb8a44f95e2d9bfcf6689b22dcfa4d89a638ed27d419ac30a8edf614","observation_id":"870997f1-a238-46ba-9621-15062607e65b","resolution":{"observed_at":"2026-05-15T22:48:36.158736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":"1905.13319","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-07-03T23:39:04.460325Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","venue":"cs.CL","work_id":"4539c966-2fd4-4238-88a9-60be171a99da","year":2019},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:c80ead54411cc02730e4ee6a9cb0b96718da0f81109da50b5e7d04238c9822df","observation_id":"d1cd4675-d148-49ec-83aa-f27646c114b0","resolution":{"observed_at":"2026-05-15T22:48:36.165171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:9d67013c9ffce59ad59eb6a7a2c36204e9d01146a15141b00064a396db3f2d8c","observation_id":"b68c5258-c5f5-4c65-9218-d7ae9dfbe218","resolution":{"observed_at":"2026-05-15T22:48:36.170435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"34bcc75b-fc4f-4231-9e33-bb09311470e9","year":2016},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:be9585f3e98b96d0fd23e1581fde91b36b88864d902c23d1c7c761c351676f12","observation_id":"4ff7a157-9cea-4507-9a94-603d65004d8c","resolution":{"observed_at":"2026-05-15T22:48:36.485671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"7e5e4e48-556f-43a2-8633-56a168a1ba55","year":2022},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f4d22c9efefef0e4062b007e30f411601c919e7e5b53ee38e23ff64fb236990c","observation_id":"1bae69d0-906a-439c-85b2-88986031b429","resolution":{"observed_at":"2026-05-15T22:48:36.490887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvqa: Knowledge-aware visual question answering","venue":null,"work_id":"bc958e67-e91a-47a9-823c-3e0937a36096","year":2019},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:97ac8e39d89c948a5725ef6edbba25d64346dfd87b515ef0a25cb3bd4b43ef42","observation_id":"ff2c45bd-46e6-49eb-aad0-577cd69570d3","resolution":{"observed_at":"2026-05-15T22:48:36.496181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":"4cb3b3c4-eb27-4b60-bef2-a5a53d463491","year":2018},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f1d427177e310ea9f31932a30ad7ee60882a0c80ba59c4368a4b74bca5763830","observation_id":"4d5f6864-0574-45c1-bad7-b61ea9124b9c","resolution":{"observed_at":"2026-05-15T22:48:36.500507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:94843c573ee1a87b704167dcfb11e6a3055a9d0a6a1e8ec0475e9aacb20a9dc8","observation_id":"e743cdce-d27e-420c-86bd-5bda1ef7735c","resolution":{"observed_at":"2026-05-15T22:48:36.204456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08172","last_updated":"2023-11-25T07:59:48Z","snapshot_observed_at":"2026-07-06T16:47:21.000236Z","submitted_at":"2023-11-14T14:02:32Z","title":"Vision-Language Instruction Tuning: A Review and Analysis","version":2},"cited_work":{"arxiv_id":"2311.08172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08172","snapshot_observed_at":"2026-07-03T17:18:43.807479Z","title":"Vision-language instruction tuning: A review and analysis","venue":null,"work_id":"bd5c335f-7dd2-422c-b780-32074a645929","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2311.08172","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:91c62d775f0680919c237f02cf3dc47fa8bb701bec70a28cc66120f594482f81","observation_id":"8a249b44-2ff4-4a28-9c62-3e1c21cbc9be","resolution":{"observed_at":"2026-05-15T22:48:36.211979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:11dc98e6cb2df4ce8f5284ea6e3645cc1c2614e29305eb893fc38dcef3e79ed4","observation_id":"e4c6ebed-d918-48a8-a469-81cab83b8464","resolution":{"observed_at":"2026-05-15T22:48:36.219428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2402.11690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-06-29T18:33:50.167861Z","title":"Vision-flan: Scaling human-labeled tasks in visual instruction tuning","venue":null,"work_id":"ae4478fe-947a-4169-8502-1cf8aa338387","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:db0dfd19145c836f23e8fea58b1461bbf75dacb0e3ec98d325011fe1fddd0fbe","observation_id":"f13163c8-e6d7-4c9f-a577-0302221d0768","resolution":{"observed_at":"2026-05-15T22:48:36.226183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":"f7996eaa-7d6b-461a-b4ab-176736a319d1","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:2afbbce3fa7c4be047b25a61729dd23b02ca2c4c7987297992b5d09f9f80422a","observation_id":"476497bc-6afd-4296-bf68-7db0f11ef57c","resolution":{"observed_at":"2026-05-15T22:48:36.505594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"d2b39bf3-0b65-431a-a94d-e7394f9d1177","year":1956},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:f41cff03ccbd1392ed69a97293c7f51137d51d04309d4b6d241679eede7aa6c5","observation_id":"95604341-dd39-4e1b-b8e9-60e8d8468295","resolution":{"observed_at":"2026-05-15T22:48:36.510307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual storytelling","venue":null,"work_id":"e71e05c7-9ea3-40e6-a450-8edd4752ab93","year":2016},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:783d3b01598dacfc7ab402968ca04c6e06f356b7ca5047df3212bb743d733aed","observation_id":"71e058d6-6854-4490-acc1-04e29e41928f","resolution":{"observed_at":"2026-05-15T22:48:36.513926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"person standing in a small boat","venue":null,"work_id":"468bef6a-56cf-4f2c-b64b-0afa6616a98d","year":2021},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:34d4e7a140554557f798326ad6621864f39bbdd92456575ac6cbd81d01ebc6e4","observation_id":"3e50229a-b751-4304-a6d4-2ad148231ed4","resolution":{"observed_at":"2026-05-15T22:48:36.400918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":48,"verified_fuzzy":27},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 76 of 76 outbound references and 59 inbound Pith citation observations for arXiv:2404.14396."}