{"as_of":"2026-08-22T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:339ad2a6833f2952ae315f2b097c133a46da9e66d63d86aa0f7dbb80a64f1733","coverage":[{"denominator":151,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:56:34.034047Z","state":"measured"},{"denominator":109,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":109,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:17:33.562911Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":"2605.18678","doi":"10.48550/arxiv.2605.18678","metadata_source":"pith","pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","venue":"cs.CV","work_id":"9857b6f6-3122-4f3e-b1c4-337beb1d8efa","year":2026},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:637cf4379c49ec100e12baab9880ecddc4991c67256999f099da4062e3ee0737","observation_id":"cd6a6a09-d9f0-4481-adb5-d8c4ca9297f9","resolution":{"observed_at":"2026-06-29T23:04:01.804804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":"2605.18678","doi":"10.48550/arxiv.2605.18678","metadata_source":"pith","pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","venue":"cs.CV","work_id":"9857b6f6-3122-4f3e-b1c4-337beb1d8efa","year":2026},"citing_paper":{"arxiv_id":"2606.24441","last_updated":"2026-06-23T11:19:34Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T11:19:34Z","title":"S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T00:20:42.801659Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2606.24441"},"observation_digest":"sha256:6a9ff041d478e499dbc645701c177ead01671abc413709ad7b038d3915e90e9f","observation_id":"e4a15058-b41f-4fa0-9ef2-a7d55f221d97","resolution":{"observed_at":"2026-07-04T16:39:58.068623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":"2605.18678","doi":"10.48550/arxiv.2605.18678","metadata_source":"pith","pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","venue":"cs.CV","work_id":"9857b6f6-3122-4f3e-b1c4-337beb1d8efa","year":2026},"citing_paper":{"arxiv_id":"2606.27187","last_updated":"2026-06-25T15:50:33Z","snapshot_observed_at":"2026-08-13T01:36:00.861928Z","submitted_at":"2026-06-25T15:50:33Z","title":"HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T05:48:34.492354Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2606.27187"},"observation_digest":"sha256:6d775b53394f736d44bcf0e7798ae04bfd4a7887216415b2d43e354e5fa59b95","observation_id":"efb55953-d674-4c7c-92f9-2ca0dea6b9aa","resolution":{"observed_at":"2026-07-04T12:49:53.015032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":"2605.18678","doi":"10.48550/arxiv.2605.18678","metadata_source":"pith","pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","venue":"cs.CV","work_id":"9857b6f6-3122-4f3e-b1c4-337beb1d8efa","year":2026},"citing_paper":{"arxiv_id":"2606.27187","last_updated":"2026-06-25T15:50:33Z","snapshot_observed_at":"2026-08-13T01:36:00.861928Z","submitted_at":"2026-06-25T15:50:33Z","title":"HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T05:48:34.492354Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2606.27187"},"observation_digest":"sha256:5fad6075dd823955bb9b9eac164cd62b729954af27db6814e710e614f1146d12","observation_id":"48f4cefe-1474-4347-8733-e1684dc7ccbc","resolution":{"observed_at":"2026-06-26T05:49:02.609960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-03T04:58:50.332245Z","title":"Lance: Unified multimodal modeling by multi-task synergy,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29545","last_updated":"2026-07-31T15:38:56Z","snapshot_observed_at":"2026-08-12T23:03:38.793052Z","submitted_at":"2026-07-31T15:38:56Z","title":"MoRoute: Dynamic Routing for In-Context Multimodal Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:58:50.332245Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2607.29545"},"observation_digest":"sha256:d9e879efbe5df9147bfbf0783fd5998b805a0b2de53fa8413db93e5570a922b1","observation_id":"d2c65a08-fd6b-4f1f-bbf4-a6baa1149595","resolution":{"observed_at":"2026-08-03T04:58:50.332245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-06T11:55:27.862037Z","title":"Lance: Unified multimodal modeling by multi-task synergy, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:27.862037Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:fe4a7290c888835913db104b7d7a34973cc027594e657136ef2e1585d7164318","observation_id":"87316730-cb9d-464f-b5ad-91b868596498","resolution":{"observed_at":"2026-08-06T11:55:27.862037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-08T17:08:54.580802Z","title":"Lance: Unified multimodal modeling by multi-task synergy, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:54.580802Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:cb50128a96a7a022248854c293809fb96504c1a6d2c3d6f3c4d23b99cb19ba3f","observation_id":"8ed3445c-2933-41fe-91ec-e14877428f08","resolution":{"observed_at":"2026-08-08T17:08:54.580802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-16T00:17:33.562911Z","title":"Lance: Unified multimodal modeling by multi-task synergy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-20T04:57:30.183021Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.562911Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:4b1b3abebd465737fa36bc0934a3a67e39ac6b9dc930545a6724b7b0a55b6f88","observation_id":"569f7263-26fc-45b3-8025-46d8129b94ac","resolution":{"observed_at":"2026-08-16T00:17:33.562911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-15T21:00:35.762221Z","title":"Lance: Unified multimodal modeling by multi-task synergy.arXiv preprint arXiv:2605.18678,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12904","last_updated":"2026-08-13T07:41:14Z","snapshot_observed_at":"2026-08-20T10:39:34.315325Z","submitted_at":"2026-08-13T07:41:14Z","title":"HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:35.762221Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.12904"},"observation_digest":"sha256:00f55e08cbedd04db6980e4d07a80999799ba1e9068ad86ee362f654bd96f808","observation_id":"6589330e-2668-4861-94ce-e2b11e0bead1","resolution":{"observed_at":"2026-08-15T21:00:35.762221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18678/citation-record","integrity":"/paper/2605.18678/integrity","json":"/paper/2605.18678/citation-record.json","paper":"/paper/2605.18678"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:3d3e2c113c1a50cd7ceadf30b9276f38835c00799277869880277b236562ea4a","observation_id":"76f04b48-247a-4110-827c-7c13582eb821","resolution":{"observed_at":"2026-05-21T07:59:50.564591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.833831Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"b61d581d-a5f8-4799-a638-d91ddfc06da4","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:82557f67774651f10d2bb8d60594e96dc4ff9ffe22d026bc8a6e3a9a7c38c51a","observation_id":"995c1c97-5af1-4b03-bae1-01630cf359bd","resolution":{"observed_at":"2026-05-21T08:14:52.355723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9fa76215752c9dafb73f7e23ebfcb1d09140448abe84f4f7e359b9c84c66b890","observation_id":"19b9e6fc-8593-4b9d-aa26-c6f3fcacc501","resolution":{"observed_at":"2026-05-21T07:59:50.691656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7519ffa6cd10bc5dde5887a76b4f6301aefa323d59a44fb879d6813df1965611","observation_id":"b9956c71-7feb-46b8-92ad-0445151d940d","resolution":{"observed_at":"2026-05-21T07:59:50.583873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d847033c276d9721eac7c939becdb847862c320c14d14e4bda6ecd8e08222937","observation_id":"58cdf9be-a587-42b3-955d-9ac8e02e3d84","resolution":{"observed_at":"2026-05-21T07:59:50.720587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":"fb7509a6-ece6-4ea3-b583-1ec884016dc8","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7605ac550e858fb481ab08b20848e2779ff958f105e0c1eae84adff5f252d53d","observation_id":"df09cb3e-1d81-4d59-84a3-c5e1a487817f","resolution":{"observed_at":"2026-05-21T08:14:52.352672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18616","last_updated":"2024-11-27T18:58:52Z","snapshot_observed_at":"2026-08-18T16:47:31.833926Z","submitted_at":"2024-11-27T18:58:52Z","title":"Diffusion Self-Distillation for Zero-Shot Customized Image Generation","version":1},"cited_work":{"arxiv_id":"2411.18616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18616","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion self-distillation for zero-shot customized image generation","venue":null,"work_id":"b5301a77-2704-4b76-b316-890aa31e5544","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2411.18616","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e7e4ce52296438ae952faf6f441bc77e4ba713746c93d5b0a63a97512c0ceab8","observation_id":"bba7fdbd-3482-4775-b6ba-073f017e7ef1","resolution":{"observed_at":"2026-05-21T07:59:50.759531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-16T05:43:37.647093Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4e4618a328e5add07a00caabdb51565629cf629152dcecb709ab9e5000d04547","observation_id":"17f51a29-40c0-43d4-898c-1482aa940cf2","resolution":{"observed_at":"2026-05-21T07:59:50.574885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"2fc686b5-edc0-473f-b96d-ccd1259d1ef5","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:fe0a2718ff91862e1406cce09339cf4a182bc08392682e68b00ff4cbec07ae83","observation_id":"9a3e0a54-70b4-4614-b7d5-739b5fea1eb9","resolution":{"observed_at":"2026-05-21T08:14:52.332264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"f4a59010-4a0b-4d0e-aa28-44321c465d06","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b40d26d62d815e7243515c06291890a7afc6a62fa4aeb131f1b6bc6902beff60","observation_id":"7e478804-4605-41bb-93b6-ca5866600e8a","resolution":{"observed_at":"2026-05-21T08:14:52.339263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:42c27a8e625b282d66fd48cf0a30312b8b3cd5403a54acc1a8fb5e2eaca4c5b3","observation_id":"a7da9052-8c29-4148-8e9d-8da1f203e3c9","resolution":{"observed_at":"2026-05-21T07:59:50.580858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixart-σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":"31cde7d3-e840-4c03-929d-e4fdb79a971c","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9b791aedc8e83d601591cd898761bcd154a6f61fb73c703ba36a1ca776ca5f90","observation_id":"b0bc4d67-3364-4bac-ad67-bd0102cb5a3c","resolution":{"observed_at":"2026-05-21T08:14:52.343643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-15T16:39:44.454451Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":"2411.18211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-07-03T10:27:56.044849Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localization ability","venue":null,"work_id":"096f37ba-17eb-4a5f-8559-3ab32ce1a3ed","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:12bf359d01bb2e6a3cc8642996d6959bf3d6a82bde5dd33bb30b645d3090691b","observation_id":"e81e7832-46d1-4918-8585-db1038c7d55e","resolution":{"observed_at":"2026-05-21T07:59:50.479363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-21T20:37:42.923128Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:99f3f4dc0d10100f241cbbcb3a0a5b8f695b0e1a7876f0c69d734d96da5d01ba","observation_id":"611133b9-3f0a-41af-972c-c23a0b138a8b","resolution":{"observed_at":"2026-05-21T07:59:50.488907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"27ad3630-78a4-4bbf-96d2-1a629edebd68","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:14e2f30b422e73f722ae060e76877243ada80057931674a67b2d1ab39d4f9776","observation_id":"00123fe2-4cba-471b-ab1e-7b52c41676d9","resolution":{"observed_at":"2026-05-21T08:14:52.323032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.707184Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"9ead6e75-42df-4630-bfc1-0cc11eb55ef0","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9e789beb286ffc9b238b13ea4062201d4c1f58465d79c814d4567c4de516104f","observation_id":"3a05cbe2-d270-4427-8349-e48014c6e614","resolution":{"observed_at":"2026-05-21T08:14:52.325322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06818","last_updated":"2025-09-08T15:54:55Z","snapshot_observed_at":"2026-08-17T16:50:28.882150Z","submitted_at":"2025-09-08T15:54:55Z","title":"UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward","version":1},"cited_work":{"arxiv_id":"2509.06818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06818","snapshot_observed_at":"2026-07-04T13:39:50.192540Z","title":"Umo: Scaling multi-identity consistency for image customization via matching reward","venue":null,"work_id":"6e4027e1-5a9a-4fed-90ee-38eb4eb67ab9","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2509.06818","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:3062f9877676427275107502830c2a358667a3209becdc3e5fd0ad797c384399","observation_id":"94e83882-5ab2-49c1-a065-6d4a07dc09ec","resolution":{"observed_at":"2026-05-21T07:59:50.448844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-08-14T05:24:51.715708Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.05595","doi":"10.48550/arxiv.2507.05595.url:http://arxiv.org/","metadata_source":"pith","pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-07-11T02:17:46.362300Z","title":"PaddleOCR 3.0 Technical Report","venue":"cs.CV","work_id":"444c549c-1895-4cae-a2d3-c13d7ed5f462","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:6b0fa89106522179badf50bab28f20a70373dd77634ae9cca61442e854b481e8","observation_id":"a5d1dbaf-8baa-427d-895d-a97bef0a3d2a","resolution":{"observed_at":"2026-05-21T07:59:50.694759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:225871ec987ebf5fd71c4c052701061d91219ddd22654c4ceb99cb47de513342","observation_id":"9813bfcc-dc4c-435b-92d1-de6b9fce24e2","resolution":{"observed_at":"2026-05-21T07:59:50.460568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"c019e1cf-92de-4a7a-aa6a-c66bed78ddcd","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:314a8e185df75768583c05953ef88d3aba4c2934d7b82d8e832d6bbcb30df70d","observation_id":"73f0a0e9-3b2c-4d3b-ab98-054ea216cbfa","resolution":{"observed_at":"2026-05-21T08:14:52.345884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06442","last_updated":"2026-06-01T15:54:20Z","snapshot_observed_at":"2026-08-20T02:15:23.483662Z","submitted_at":"2026-02-06T07:11:50Z","title":"ChatUMM: Robust Context Tracking for Conversational Interleaved Generation","version":2},"cited_work":{"arxiv_id":"2602.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatumm: Robust context tracking for conversational interleaved generation","venue":null,"work_id":"6c1fcebd-1fe2-4179-b518-3b6bcf72241f","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2602.06442","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7b3f5143968d070bdc5439511777fa10ab71322f41f7b5b361803b997b3c994b","observation_id":"02508724-e637-43cf-b990-f1efea13a798","resolution":{"observed_at":"2026-06-02T04:04:28.060339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":"c4451f0b-8d33-4df2-a382-295822d290ea","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b7c3dc28f78b4b412ddff804905cec4c0ff6c0829f8f4e987ad198a3de9032f8","observation_id":"1fb140fb-cb35-449a-8f1d-615d3fd193ef","resolution":{"observed_at":"2026-05-21T08:14:52.348002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:675658a7b5e2ec5827b43785f34fa33edf3f1c4f26cb62571dfaf757b369bcf2","observation_id":"48a508c7-b0f0-4546-aa2a-62fb452f7ce1","resolution":{"observed_at":"2026-05-21T07:59:50.767254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogview: Mastering text-to-image generation via transformers.NIPS, 34:19822–19835","venue":null,"work_id":"01d7ab46-1308-4288-98c4-f8a21cf53ea1","year":2021},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:c22cda118296f6c700e153aeeeef698bb59a136b9a1444c28b307297512b51e6","observation_id":"7fd5e614-ce13-465f-85cd-b7f508f632e5","resolution":{"observed_at":"2026-05-21T08:14:52.294713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:00.999777Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"78c48128-f71d-483e-a835-f5f08e80afd7","year":2021},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0775d6d8c4f84b0d1114b9b93cf736c06e0dfd8e9537d9a646d9411d6f230687","observation_id":"02a9cb21-26e2-45a1-916c-69d3f140e8ce","resolution":{"observed_at":"2026-05-21T08:14:52.289983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"195c5b6f-6b08-467c-85c0-66c39a968eab","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:26a369fcfd202fb4912692b9bee9116a38eac3a37e946625997829205617836e","observation_id":"ede6043b-ad4b-4bbd-9cba-91eedc485ce2","resolution":{"observed_at":"2026-05-21T08:14:52.341546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-08-19T18:23:38.799470Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":"2503.13436","doi":"10.48550/arxiv.2503.13436","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified autoregressive visual generation and understanding with continuous tokens","venue":"arXiv (Cornell University)","work_id":"873a4565-755a-433c-9cdb-43d528548dd2","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:90cb984302430a8da379a1c3f4e2afe4ea71da1cd6e00b7b3c424137dafebfb8","observation_id":"d5172ce2-5713-4439-8ec6-0c928cda97c6","resolution":{"observed_at":"2026-05-21T07:59:50.752143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-16T13:23:55.587572Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":"2408.14023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-07-04T09:39:46.765108Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos","venue":null,"work_id":"2ed72cbe-f6a7-4149-911f-be5ff9cb6d0e","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:277148ad10d69ed8c5bf382b44a931438f9dbac431511ec936908aa29ff0956b","observation_id":"60c46325-5641-4837-a59b-d9537c6f88d3","resolution":{"observed_at":"2026-05-21T07:59:50.748177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:56:55.080161Z","title":"Dreamlite: A lightweight on-device unified model for image generation and editing","venue":null,"work_id":"dbec008f-66b4-4d1b-a924-8a62de62629c","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a28be2a9c397dd640d1c4284c09525e3a4ed8893d3b0fff24b3e72b0bd3bcd54","observation_id":"b5f3473d-104f-479a-a975-1291945aca4a","resolution":{"observed_at":"2026-05-21T07:59:50.738528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feededit: Text-based image editing with dynamic feedback regulation","venue":null,"work_id":"8bf2f0c7-20b9-4447-a6fb-4db1cf4af279","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:6d782c176ac15df26906604504ea5e4f1369241b8672157db08bae872b340a1c","observation_id":"292da351-5d4b-44ff-a72d-ee1556019aad","resolution":{"observed_at":"2026-05-21T08:14:52.275654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layeredit: Disentangled multi-object editing via conflict-aware multi-layer learning","venue":null,"work_id":"343f736d-cce9-4f06-8b86-40053a596fb5","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:979279ac152decfd1f061e0df12f902556a7b25f3e82576df02c3133bb6e556f","observation_id":"faa5f6d2-ace7-41a3-bb0d-bfeefba198f0","resolution":{"observed_at":"2026-05-21T08:14:52.268752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance","venue":null,"work_id":"314af350-8034-4394-a17a-6050b548e58d","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7c3622adcb6685a6193a603fa8f2c160deb648a3de59f2bd640596768138f567","observation_id":"6f7d5ead-01ae-4faf-a593-de9c9a5619cd","resolution":{"observed_at":"2026-05-21T08:14:52.266580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2404.14396","doi":"10.48550/arxiv.2404.14396","metadata_source":"pith","pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","venue":"cs.CV","work_id":"15953092-dd9e-49ae-9f72-e28fc93a6068","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d4fa5e20c14670835b545e1056c2d777b6971e3f87fb85f01b705096719859be","observation_id":"1edc4828-c9a1-4244-acf0-7d70a78b3698","resolution":{"observed_at":"2026-05-21T07:59:50.734734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advancesin Neural Information Processing Systems, 36:52132–52152","venue":null,"work_id":"548de86b-86d2-4d3c-b90e-345344de3902","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:06a621c0f1d1bac817c7436fb601ad00cf4b4229607cbab07c4f7baee02e059b","observation_id":"7fa33aea-fdaa-43b7-996a-1dfadf59551e","resolution":{"observed_at":"2026-05-21T08:14:52.216706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3 Pro Image Model Card","venue":null,"work_id":"7c675ccd-9adc-4380-8bf1-cc9a1f3ae721","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:66ff975bdef0555e57afd1712bf5b2d3471261e8b51965e7a8f315e2cecd5aec","observation_id":"d40669be-151e-4975-b21b-2fca56e80afd","resolution":{"observed_at":"2026-05-21T08:14:52.336859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:91b8b57788b71cf1dd8b474cea0b7081d26fd517498c1a6e970dce7dfa565467","observation_id":"91d1bb12-0a51-463b-9cb1-d48933ed202a","resolution":{"observed_at":"2026-05-21T07:59:50.731308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05103","doi":"10.48550/arxiv.2512.05103","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tv2tv: A unified framework for interleaved language and video generation","venue":"ArXiv.org","work_id":"052cc341-7394-470a-9f9d-cd282a3272e0","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a9f2813f4aaf83f6c31a2f822404faa020716d7b3710741824cb0593dd77052b","observation_id":"be4499ca-34fa-4c9a-84c8-9a360a5777c7","resolution":{"observed_at":"2026-05-21T07:59:50.743666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:04:20.895613Z","title":"Emma: Efficient multimodal understanding, generation, and editing with a unified architecture","venue":null,"work_id":"e4ea8fa3-ab7d-43ce-811e-4031c8d93ec0","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0f4ac4cc00e35187f8630671391b1586eb6a2fef3df2cd3da773aad14035a199","observation_id":"7d918d47-cfee-4b84-8f9e-cc94aa5403cd","resolution":{"observed_at":"2026-05-21T07:59:50.755818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e998dc88e5bbe5ba1db40ef06a06055482f87f6b252a1d5c102ca1cef9d9c732","observation_id":"35cd92d7-e045-4e21-9fe5-a80380e5af89","resolution":{"observed_at":"2026-05-21T07:59:50.610876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models.NIPS, 33:6840–6851","venue":null,"work_id":"531958c2-549c-4e29-85e6-e0e0683c27d1","year":2020},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:c43e317ef3dcca8e83eef6ce6bf7355334932e400972023e2f4c66ee548f1d2e","observation_id":"a6143f1d-c9f3-4681-b171-8e2b9e1a30b4","resolution":{"observed_at":"2026-05-21T08:14:52.211787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:82cb5b02f38952a04733dc68427e2b3860bd47bafdada27afd2d85a3b1f9d6b4","observation_id":"f964116d-5729-4333-813b-ba0bf40e55ce","resolution":{"observed_at":"2026-05-21T07:59:50.728150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e5bf203c5c030f0f4b6ade57e8ab39320eed9434fd216fa4a720dc7e65564124","observation_id":"663963de-e5fd-4d60-9076-f1f594dce0ce","resolution":{"observed_at":"2026-05-21T07:59:50.717242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dse-gan: Dynamic semantic evolution generative adversarial network for text-to-image generation","venue":null,"work_id":"e01fec0a-cf18-4fe6-a575-21cae83e2285","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:054ae50b6f6a4d894f6ff77e95f2bbd44f268ee65f7dc9c190df274d92d36f1c","observation_id":"da9ec087-5f62-47b2-b537-7de764840ed1","resolution":{"observed_at":"2026-05-21T08:14:52.214275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards accurate image coding: Improved autoregressive image generation with dynamic vector quantization","venue":null,"work_id":"dbbecc71-beab-46a0-8031-8056c943fe1a","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b6a05c91b408bb8c2e257831b4d75e2496c6306c337d68b88c3110bccb9233f2","observation_id":"eb69059c-3617-4839-ae24-2b70e7937980","resolution":{"observed_at":"2026-05-21T08:14:52.254568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realcustom: Narrowing real text word for real-time open-domain text-to-image customization","venue":null,"work_id":"1a81d3ac-de24-45fe-af07-b02abe68bed7","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:583f7428fd73a527f5209f50d697084fb6b90d12b7a485f9880b1558d03d3286","observation_id":"a2d11953-8a1e-4a56-bffc-037cbb247d59","resolution":{"observed_at":"2026-05-21T08:14:52.219234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.Advances in Neural Information Processing Systems, 38:167283–167308","venue":null,"work_id":"f9a5e07e-9dbb-4833-9be5-a70f6384f032","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7aa8cb1d21f9b2c375114b34e87990d72af7e0ea1b825e6e5f7f1061b3f9d2db","observation_id":"07d9c40a-6b4f-4272-8c65-171a4b918770","resolution":{"observed_at":"2026-05-21T08:14:52.209335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T23:44:22.326016Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"9f23bd16-4e15-463f-941a-93528f3b5926","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:2f0f1e405e2deb1bdd2619e978db2d39c70ac6d81e30a49c530bc3337652ad3f","observation_id":"386afc2f-968d-41e7-a1d1-794e78a54dd1","resolution":{"observed_at":"2026-05-21T08:14:52.278099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":"97d2dc71-ce9e-4748-97e6-5cdc37f4df63","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4b4d79d23bd6011dc3e8fda47baccf51bf7afd52ee60621e2e6ff8736305a734","observation_id":"a6fffe26-aa79-4e9d-8108-a06aaf7e0ad9","resolution":{"observed_at":"2026-05-21T08:14:52.327433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-08-17T05:59:16.348201Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"cited_work":{"arxiv_id":"2509.20360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20360","snapshot_observed_at":"2026-07-04T13:09:51.206475Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","venue":"cs.CV","work_id":"3100bcea-8034-4051-8a0c-f45cde73d2d6","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2509.20360","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:5b550b8716222ae6fc028a08a78d5f4eff2aeabfb2db29f2c8bc821c6dc56458","observation_id":"d9baa9e7-5671-43c7-bbaa-3d1cbcb8f471","resolution":{"observed_at":"2026-05-21T07:59:50.706658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-08-17T07:40:15.098041Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":"2503.19907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-07-03T17:08:42.921278Z","title":"Fulldit: Multi-task video genera- tive foundation model with full attention","venue":null,"work_id":"d3c75fb5-7649-4107-aec0-9801737dfb8e","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:139e207d7a4bf499937e18fdf90629783f9acd7bca6ef1ab17757b59d10848a1","observation_id":"3c03f3d8-85e4-441d-9848-c4352dbde82c","resolution":{"observed_at":"2026-05-21T07:59:50.710354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling ai.https://klingai.kuaishou.com/","venue":null,"work_id":"ed34266a-f9a4-46a8-bf03-9f4cd3759141","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:8a1eabb0c69e2becd9f0e371b31543579eac90edf72b47b184942a109a4dddfb","observation_id":"45936d82-8f83-44b6-8311-49d512248324","resolution":{"observed_at":"2026-05-21T08:14:52.235954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9f4d55239526ea4844c2afc9db58864bd9f26a64006a3340ce4059671725cc0d","observation_id":"a5986faf-0494-466a-9eb0-a7170ce8fea6","resolution":{"observed_at":"2026-05-21T07:59:50.713727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-20T10:54:54.725127Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":"2403.14468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-07-04T10:29:44.541818Z","title":"arXiv preprint arXiv:2403.14468 , year=","venue":null,"work_id":"91372074-cd42-4426-bf90-2d27dee1a1c9","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7945c31d26b736e4b3626c2d6e134bed27ebb891d6f710ac005c395b11dbb4f3","observation_id":"5557a68d-39cc-45bc-8e98-f18b1d8cc77d","resolution":{"observed_at":"2026-05-21T07:59:50.724598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux: Official inference repository for flux.1 models","venue":null,"work_id":"09a2455b-75e8-4046-9f34-29459e096cf2","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a1b10ddcd33623d828cbc0c6b0806951399c4f80ebaf13213646b75f690c9dac","observation_id":"93676173-f707-4a8c-8f4a-0de9b130506e","resolution":{"observed_at":"2026-05-21T08:14:52.238117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0c4de1244c2f3a0dcf3db3ec0c3ca69d101c46d266f0ed727769b4a3cc28697b","observation_id":"ad3a9c14-1654-40d4-abda-6ef04d860b96","resolution":{"observed_at":"2026-05-21T07:59:50.762545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advancesin Neural Information Processing Systems, 36:71683–71702","venue":null,"work_id":"507a02d5-f4bf-43ca-a250-b88dadf27a71","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:dd63c3898342d4f8d04bdbdf9230788a71b6c84f063705fbe05c04845868fbae","observation_id":"a509b74f-bebe-44cb-9bf6-eb63dcc5641f","resolution":{"observed_at":"2026-05-21T08:14:52.247695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:f3d70c4c32b9370c846c328ec6ed5932b4cf095d9b7b06c207c689ad97636ccc","observation_id":"bbd74472-1af9-475e-8d86-9ca007f2e93c","resolution":{"observed_at":"2026-05-21T07:59:50.688079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"f08e8c5f-3dc9-4d3c-bc1c-0900e55cb997","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:c7e461be894bbc9b553bce844312fc4b271a7ff1b1eefba9ccd201d90d082281","observation_id":"29b32ebf-ba79-417c-88f8-bc803f973a36","resolution":{"observed_at":"2026-05-21T08:14:52.231355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03498","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.074454Z","title":"Onecat: Decoder-only auto-regressive model for unified understanding and generation","venue":null,"work_id":"b201beef-0544-4d04-9644-65dfeacb78bd","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:756ce2ebe17b28047714a2dad9f961ac9ec26bf914313128854e3604b9d84b97","observation_id":"ae29a190-bdb5-4310-9852-4da3f427fe7c","resolution":{"observed_at":"2026-05-21T07:59:50.445066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T22:40:10.912714Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"29bef5f1-e6a4-4e87-8fbe-118e1444be6f","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0d6f69f80f66b6a6553f36f664549718bc4dbedcf6f6d81476691414d61056e3","observation_id":"5ae2595d-4e4f-4bdc-8a6e-1eb41e5b8841","resolution":{"observed_at":"2026-05-21T08:14:52.233836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videochat: Chat-centric video understanding.Science China Information Sciences, 68(10):200102","venue":null,"work_id":"365c0967-1b1a-4988-af69-b5b560a1f136","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4f1a8d8ce5ec6348746a9ec42c256224c8f5fd78d4748fee98c20642af56b076","observation_id":"2ec55ac7-abec-463a-862a-d06f8bc4793a","resolution":{"observed_at":"2026-05-21T08:14:52.240248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoregressive image generation without vector quantization.Advancesin Neural Information Processing Systems, 37:56424–56445","venue":null,"work_id":"23dc71df-dd40-4a8d-898a-a8d48a2884e6","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:64745bceb5fd8783ba7af62b344a5be37fe2db554652357490a796c47aca39fb","observation_id":"9432ac7a-6425-4881-acf3-0704c5976927","resolution":{"observed_at":"2026-05-21T08:14:52.243040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:502e3f68f3295eedbe3d59c3f24e33e153713838338ccac9381de83b3735723c","observation_id":"5af6ba44-4ffa-4bc4-afed-bcf0c6fd1524","resolution":{"observed_at":"2026-05-21T07:59:50.676924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":"2505.05472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-07-10T07:36:57.986858Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","venue":"cs.CV","work_id":"f2badd0e-c06a-45f9-9d9e-7ceda62176b8","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:fb4caf3b9b1047ae565a6415b1a67c7e0687ef57caef2ebba065e9519817d138","observation_id":"9a2ba4bb-835b-4156-b3ec-e3e251c52eb0","resolution":{"observed_at":"2026-05-21T07:59:50.684850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"8ede3514-97c5-46f6-a04d-5c422b117a16","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b823cfe56253329b756dfe3c443249cccbde257f7616b98f8d1ccae31946fa83","observation_id":"302463f0-8da9-4e90-a7d7-c0fd2eb37a62","resolution":{"observed_at":"2026-05-21T08:14:52.259013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b8bab7a9a0fd0c6e438b00d5c85e03af87975448ecb0aae6a8ce33a21d6b2e37","observation_id":"4a622e07-4db7-4f79-a407-80f213d6b71b","resolution":{"observed_at":"2026-05-21T07:59:50.680120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.459903Z","title":"Realgeneral: Unifying visual generation via temporal in-context learning with video models","venue":null,"work_id":"75fda85c-e312-44b9-a6e5-8b9be377ac25","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0639f80ce45e930e4b60fa76cea6db532050aace6724a2bab87e95cbe7719e55","observation_id":"26cb367b-8230-424d-a95f-e644d662139d","resolution":{"observed_at":"2026-05-21T08:14:52.261505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-20T22:22:58.160467Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":"2412.06264","doi":"10.48550/arxiv.2412.06264","metadata_source":"pith","pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching Guide and Code","venue":"cs.LG","work_id":"2be93143-ab6f-48d6-96d5-3e85d7246f07","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b8186de9297fa59005b81a283e7015d56c4877b8d959d1b74343ba64c4af0acf","observation_id":"c5ebd359-6ad9-450e-803b-c3b7c4e26826","resolution":{"observed_at":"2026-05-21T07:59:50.660003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d5f460f12884705573f3aafac45c0aa897df45bdf35d3d5878efa18f9a600835","observation_id":"d3083b19-dcad-4494-a176-49a73d4c1d9c","resolution":{"observed_at":"2026-05-21T07:59:50.655777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":"2402.08268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-07-04T10:59:46.566942Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","venue":"cs.LG","work_id":"162054d2-6f8e-4dc0-87b8-ebff78210c7c","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:f40f7602594647bfe14def52360ca26a17d7756e04ba37a3f2cfc531b36be9bb","observation_id":"94646241-b5af-4aa6-9c8c-8810edf43c51","resolution":{"observed_at":"2026-05-21T07:59:50.648173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.690179Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"115823a2-8918-4227-8872-3d0a36ff07a9","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:01bf936c0456d1aaa9df02f22815f34d10a01ddf2aa9043dce6305b4b9b985ec","observation_id":"78b334a4-5717-490c-a7d4-db9d56b1475a","resolution":{"observed_at":"2026-05-21T08:14:52.280489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"a5ff1e18-6f12-44b5-b914-993a44420e70","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d0eb81c3f89a4bebd39681c9b5857ea4e12edf036008aa9381c91dcf87c9444f","observation_id":"49cafb6d-6686-4c3d-b18b-ab9f62b6bb35","resolution":{"observed_at":"2026-05-21T08:14:52.315655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"582bb26f-85eb-46d9-968c-f0df911b400e","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:686ed7d1cea45764f16e37f88f87d279a0eedc4a5b740b3a2050f1d771d5399c","observation_id":"0078a322-9d15-4eb2-826e-03597d4f9368","resolution":{"observed_at":"2026-05-21T08:14:52.313485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-08-16T13:05:43.137904Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2410.20280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-07-01T19:16:00.498245Z","title":"Mardini: Masked autoregressive diffusion for video generation at scale","venue":null,"work_id":"c55eb05e-1cd3-4b08-8542-48c1765a085c","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:4f3e7e39227c78cc022cc447fd6cf1983afe8054cc716ea4e148177bd1448714","observation_id":"534419d3-5744-4d85-99f0-0f81aa9bbb25","resolution":{"observed_at":"2026-05-21T07:59:50.644203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow-grpo: Training flow matching models via online rl.Advances in neural information processing systems, 38:40783–40818","venue":null,"work_id":"1f5df391-2f57-4ef4-a119-1584def6c196","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:53eb6e71c8ff1464097703565d1d5b4eb81485b9250cff1d1a27496f2b623c1d","observation_id":"d6ffab13-b578-4a3f-a279-ded3546a1c17","resolution":{"observed_at":"2026-05-21T08:14:52.306031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":"4a2758dc-bcea-4cf4-88d9-0a5ce3903057","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0aee5a1c654cc1b2bf0c757080bc274610b30afab6534724e2a74e1e9c2bddc6","observation_id":"06a61fe5-935b-4056-8de4-2b86806d98b2","resolution":{"observed_at":"2026-05-21T08:14:52.270901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b9269cf904adc9e11dc627044ceb2881baa88e15c3b43d11c8df7048b455f53d","observation_id":"e0652860-8976-42a3-9e0f-0419f411aa3f","resolution":{"observed_at":"2026-05-21T07:59:50.651883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.868333Z","title":"Tuna: Taming unified visual representations for native unified multimodal models","venue":null,"work_id":"caa100a4-03f6-4ad6-8461-4d3a89233486","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0f75a672da78ea4768184c689b17378e6e3b4ce77f1d1ded8b168af01b903ba5","observation_id":"331d4a64-a009-48eb-b850-b00ba6c6420c","resolution":{"observed_at":"2026-05-21T07:59:50.668101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:52c1910bc6b4588d8a60d888bffa87b7b6cd6c1c557f2c1b31179230b6d55022","observation_id":"1841f1f9-3efe-45ae-ad77-4ed7a70d1b87","resolution":{"observed_at":"2026-05-21T07:59:50.672370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":"2502.10248","doi":"10.48550/arxiv.2502.10248","metadata_source":"pith","pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","venue":"cs.CV","work_id":"f9be7275-0997-4f96-bbde-dcd6ea138476","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7fd89bae5536ce1aaaf24e71be9cba12b345b7bbf0c9317e6db88b6f5567b162","observation_id":"8e42cb5d-e659-4374-9e79-958876ff0e86","resolution":{"observed_at":"2026-05-21T07:59:50.631393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.455908Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation","venue":null,"work_id":"fc2beb77-f62c-4e7d-8c18-179e3b92ff63","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:e6ca3602b525dfc23fc58f2d71cfd492a2236bae4ac1c35a98007d981720d993","observation_id":"b002c5a8-d3da-461c-b753-7586e3b20a43","resolution":{"observed_at":"2026-05-21T08:14:52.303758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"b92fde5d-180f-4e6c-9f62-e588bd468021","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:3ee602fe41037634e80f0c7646555550547f14c4162bb95debd2954e5259c0be","observation_id":"ef678626-0e70-4da0-9fe6-fec4d66b39f7","resolution":{"observed_at":"2026-05-21T08:14:52.308326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.09744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realcustom++: Representing images as real-word for real-time customization","venue":null,"work_id":"1c45681e-5f6b-4140-8851-2fd45fd17d6f","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:556ab17dcf1a7c7a1633ffb283e587818584c43a7a9aaafb624d76fab69bf39d","observation_id":"3c17b115-17fc-459a-a86b-ee2a4091c5c8","resolution":{"observed_at":"2026-05-21T07:59:50.779597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realcustom++: Representing images as real textual word for real-time customization.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"8d211e14-7e19-4d35-b380-78c593cc226a","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:b6d761134f35816cb38c0b89928a976411ad52a9f433ef32f51817aadbfbff85","observation_id":"a235a0e1-1aff-400d-b73e-b175301bd075","resolution":{"observed_at":"2026-05-21T08:14:52.310998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward accurate image generation via dynamic generative image transformer.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"d4cc724f-33e0-4770-bea3-915511612109","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:cd957376192fa4f5233a0dd98ee46642a79fad48e4b3d7dec015e2ae2f332490","observation_id":"eca066d7-229f-49b4-a675-14467d6013f3","resolution":{"observed_at":"2026-05-21T08:14:52.318512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:42.932279Z","title":"Dreamo: A unified framework for image customization","venue":null,"work_id":"61f22b4a-7358-4c63-8711-da33ac2bde1d","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:017e942df60a0933d098316b8bf79bd11d654e692f27ab125ed47140948310b9","observation_id":"038933ab-0750-4bee-b5cc-cbb8e10582fe","resolution":{"observed_at":"2026-05-21T07:59:50.456285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"33b23618-83df-402b-be4a-13a5c1c7c9f6","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:73f5f300b9d92c5ea9e020c1b14b25ae866366f2b9c30d439288dd72ae7e48cf","observation_id":"1c1f9a08-ed54-4c58-8ee1-17c898347174","resolution":{"observed_at":"2026-05-21T08:14:52.320972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing 4o image generation.https://openai.com/index/introducing-4o-image-generation/","venue":null,"work_id":"1b2aee58-59a0-44e8-bc09-173fa033e57b","year":null},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:dd30b3185bad0b75cc48b2614644b5b7f95d8b0929f2eff6aee331ef542867de","observation_id":"4e4dc0d2-be2d-407d-ba3a-aa35b69519c3","resolution":{"observed_at":"2026-05-21T08:14:52.350436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"57627d69-b7bf-4608-b530-78c9ce866926","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d6a5e6fa5a5cab0ce79c53ee737775ac3ea4c77563063ef4da595a7f3d475dbc","observation_id":"e1a31679-76f4-4a61-ad87-963730dc4738","resolution":{"observed_at":"2026-05-21T08:14:52.299175Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-21T17:21:24.620300Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:f91aec72186cbb51b809a1c4ca1d16223b7870d85f34f6461cf3b4e17fb72f30","observation_id":"b945f899-6701-408c-9add-6365eeb1cc75","resolution":{"observed_at":"2026-05-21T07:59:50.627177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:d46a9060122a5cf955f1fe93910113163aa3c30fb27597a42db300117bd21f33","observation_id":"f4c5776c-7830-42a5-bc9a-3b6f69971c12","resolution":{"observed_at":"2026-05-21T08:14:52.301519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:f318de0815192c79e20ae2ae92eb4f805c79a069e0a2e40ad7c5d892f9bf0f22","observation_id":"cc3b0bd5-9e00-4cc4-b811-955a4a1ac514","resolution":{"observed_at":"2026-05-21T07:59:50.623503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"ba4b5a50-7cd1-4a43-9877-872431975709","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:205fea83114330e666dd67522c549590ca9c25182655482bef20e21b9cb008dc","observation_id":"3ff34f9f-16da-4616-95a8-b8c900f63293","resolution":{"observed_at":"2026-05-21T08:14:52.334560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"12c2b29d-369c-4fff-ad11-7c667db863e7","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:9633148d51879412122b5d0575c5d99eef2b7e11e9c9ee92c7b96fd01680dfbc","observation_id":"2617c859-5f6d-400f-9b06-351b2420bfab","resolution":{"observed_at":"2026-05-21T08:14:52.282991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:57:26.601106Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b3ebbc98-2134-4751-aee5-59fd941251d8","year":2021},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:2f893f0cd2fc5cf3585384d89746cc978edbea3cb5856924f28e5e284244ac6f","observation_id":"bcf12b67-f523-430b-8bcd-2f1497c1a7f7","resolution":{"observed_at":"2026-05-21T08:14:52.285355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"c641128d-801d-4ee4-9b40-a1456ded7591","year":2021},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a2bdec6126729789881105e1cea0ed98568e3bafe6864d0a3d600ec2f6e37d7e","observation_id":"83e70703-ff65-4600-80cd-f9200197a6a1","resolution":{"observed_at":"2026-05-21T08:14:52.287492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"42b404b0-ddd5-483d-8735-08e84d8f536c","year":2022},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:69569d43e92ae9f857e76e62276c5af4fefa98fc4dd8052695ec9a0968f59ffb","observation_id":"8e747262-4032-4002-872e-a828b659cdff","resolution":{"observed_at":"2026-05-21T08:14:52.297107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gen-3 alpha: A new frontier for video generation.https://runwayml.com/research/ introducing-gen-3-alpha, June 2024","venue":null,"work_id":"64712b05-7729-4162-bb3d-285ad9713110","year":2024},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:7d4aa5d26720c5bf65d855449aa830073e293acc4b48164f1dddb852598b7eca","observation_id":"7f56b735-27da-4771-a64a-4d282f3fcbab","resolution":{"observed_at":"2026-05-21T08:14:52.264193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:f9c1b830e9f26405337647a275312e4058ca0df4e5d05b684588e6cf9ac74084","observation_id":"62f27ca6-ab3f-4be2-b2d4-9c0efd6cab93","resolution":{"observed_at":"2026-05-21T07:59:50.536388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-08-17T20:41:31.115657Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:ea3f5b5dd78cf7ebd6df2e3a5df88ab10a0357c79d0444b539676b40092ec679","observation_id":"2d519c2c-e30a-484f-9084-8cf46ab2c137","resolution":{"observed_at":"2026-05-21T07:59:50.590246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":0,"verified_exact":48,"verified_fuzzy":51},"total_outbound_references":151},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 100 of 151 outbound references and 9 inbound Pith citation observations for arXiv:2605.18678."}