{"as_of":"2026-08-21T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64a83a0443a894662fdce907bab9a0d30c8825649d15ca8314ec37d32af4a2bc","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:01:21.610269Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:31:05.911595Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T16:51:14.255860Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-06T12:10:08.510929Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-15T19:53:33.201174Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T12:10:08.510929Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2507.22058"},"observation_digest":"sha256:a53ded19e7f04d220b4f050121fad42a9a90b1a18ae5d6b45f896d49e4bb2f79","observation_id":"9c05e8fc-c730-486f-bdc0-f7ccc969fa2d","resolution":{"observed_at":"2026-08-06T12:10:08.510929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-04T22:36:08.177277Z","title":"Ovis-u1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-21T08:23:59.555206Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.177277Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:a2f7b0e30fe1785c9066872e342ff72d36ba63f865e555daa4ae86f187a5b5e3","observation_id":"68f62def-fac4-4a54-b902-6a6326680544","resolution":{"observed_at":"2026-08-04T22:36:08.177277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-04T13:44:09.708983Z","title":"Ovis-u1 technical report, 2025a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2509.25682","last_updated":"2026-06-30T07:06:33Z","snapshot_observed_at":"2026-08-15T23:03:06.159778Z","submitted_at":"2025-09-30T02:36:40Z","title":"Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:44:09.708983Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2509.25682"},"observation_digest":"sha256:560d187b0b34ffb0496031e3ea99907aa0662bbb2bd7ee1e7c0ece978181f404","observation_id":"e4e1981a-d8f5-4e2e-a892-9b6253aac7b7","resolution":{"observed_at":"2026-08-04T13:44:09.708983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-11T05:29:05.869868Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:08bc0522b8768bb8b45c4e4301ff71b675efd90ccc8d02267f5b41659f9fafa1","observation_id":"388417b9-e942-4903-b2e5-7420ab00a381","resolution":{"observed_at":"2026-05-16T08:10:45.413995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2602.06663","last_updated":"2026-04-20T06:42:55Z","snapshot_observed_at":"2026-08-17T21:50:42.058336Z","submitted_at":"2026-02-06T12:47:16Z","title":"PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T07:00:18.807922Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2602.06663"},"observation_digest":"sha256:4b75e78bf35fa48cfdfedf92b9c7cdb54ef5a2ef6c11eb31eacce7b376e00314","observation_id":"c63b1aef-16f2-4797-ac9a-c00c190a6fbf","resolution":{"observed_at":"2026-05-16T07:00:42.767279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:aabccda4137d1fcd0c1e62bdee9d2a4a7403685ced99a0ed1ca2f11256d8d0fb","observation_id":"c0b3b0ae-925d-4c11-a52b-13e69920a4fd","resolution":{"observed_at":"2026-05-16T07:10:43.051870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-08-14T17:59:33.384746Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:b38a00b68c9e924d832667ee51b6dee969f68ac2adf1da15138eb06fbad90696","observation_id":"72272e35-bc7a-4e93-98b7-74e476b2700d","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-03T02:31:04.075503Z","title":"arXiv preprint arXiv:2506.23044 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-13T01:45:01.629353Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.075503Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:a7f9d0ead8694a01f0e4e372a2aa979a501e8518821c9172b28ad02c2597ae00","observation_id":"f735d185-2c74-49ba-98d9-a19ea1605fe2","resolution":{"observed_at":"2026-08-03T02:31:04.075503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.04487","last_updated":"2026-04-06T07:26:18Z","snapshot_observed_at":"2026-08-15T20:52:13.006572Z","submitted_at":"2026-04-06T07:26:18Z","title":"Training-Free Image Editing with Visual Context Integration and Concept Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:34.383852Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.04487"},"observation_digest":"sha256:1b72d212f96080fc4632b8f0d9680e87d679e2b4f10137c9fd5c604aa5761f36","observation_id":"2c9f300d-95f8-4824-a1c9-a6074134a83c","resolution":{"observed_at":"2026-05-10T22:05:47.728342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-12T22:22:06.385856Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10783","last_updated":"2026-05-25T13:18:36Z","snapshot_observed_at":"2026-07-12T22:21:23.393919Z","submitted_at":"2026-04-12T19:18:02Z","title":"Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T22:22:06.385856Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.10783"},"observation_digest":"sha256:55221574cd427d2a1e9715d38f29619f3688bbe868f2a207b34c12567222982f","observation_id":"111eae68-f7db-4cd1-a53d-15684b85ba06","resolution":{"observed_at":"2026-07-12T22:22:06.385856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.10949","last_updated":"2026-04-13T03:46:45Z","snapshot_observed_at":"2026-08-17T06:58:19.760768Z","submitted_at":"2026-04-13T03:46:45Z","title":"Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:14.491492Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.10949"},"observation_digest":"sha256:13d225226b22730a339461fe2aacc468cf921ff3bc6658c04d82fbf24f05d298","observation_id":"769cea6d-9b80-4643-bc85-90fff50cd8ce","resolution":{"observed_at":"2026-05-11T08:50:59.247101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-18T03:55:24.837739Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T06:03:06.920592Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:1a32c34ff57a8ff9d14fd851385162e7360ccb0b7b7e5b6548fee0201363a33f","observation_id":"58d72faf-f4a2-43e7-b1fa-44eb7d8d53e1","resolution":{"observed_at":"2026-05-10T06:06:18.987516Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-18T03:55:24.837739Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:58.232585Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:f964346b2a6e7e02d47903bdc0801269dc2dea8fff1470b0d914794c5ed1ea9c","observation_id":"6141e825-fa89-48f2-9b39-1e23e0800b4f","resolution":{"observed_at":"2026-05-12T07:26:29.544348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-18T03:55:24.837739Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-05T16:47:32.853010Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:4913666d3d1ea4101abe642390f8ad2807136167388d4364c1dd185d53dd5d9a","observation_id":"1337908f-8e02-472f-b4a9-bad8915ae98a","resolution":{"observed_at":"2026-07-05T16:51:14.258187Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.17850","last_updated":"2026-08-05T08:50:05Z","snapshot_observed_at":"2026-08-14T13:32:00.689935Z","submitted_at":"2026-04-20T05:59:20Z","title":"UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:04.561573Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.17850"},"observation_digest":"sha256:aa7b27a3fe47131538b4a7a91e7c0ea99f41cea879b645557d4cdf624c603c41","observation_id":"975c441b-446c-404d-b0be-d206e36050e7","resolution":{"observed_at":"2026-05-10T09:33:41.693409Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:fde0c6f012ef774c4bc3c5f5baee0726bf4cd966204a8a0a4a3ee88c70051c05","observation_id":"d6f94271-ac7c-42dd-993c-e634b5a8b48d","resolution":{"observed_at":"2026-05-11T21:41:18.983968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:4fe6f984ed1c6112dffcf23e53143087c67d9e681f7cb1a428c90b036aca6743","observation_id":"ed7f43f2-3360-479d-bc81-2260ec90bc9f","resolution":{"observed_at":"2026-05-20T23:43:51.147802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-08-12T23:46:44.282001Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:9c51d0553c70e26fe6070426786641a2b590d55618f134fffd69859e433f6a64","observation_id":"3efdaf0f-fbd8-4c7d-9902-b255e18ebbb9","resolution":{"observed_at":"2026-05-13T01:47:04.950923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:fdf6bbbca1d95d5cd313651a643a49296225239b5c02611a12b5eea283d21345","observation_id":"aadd1ce5-a9dd-4642-93a2-69c3c47df8ba","resolution":{"observed_at":"2026-05-13T05:17:18.564715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:566e76852496396338f16e0de7c028c1d2e65c129fb8e22a7ecd870084a75b7e","observation_id":"bfd24f7b-55d3-4bca-9c8e-6d77ce01bf63","resolution":{"observed_at":"2026-05-20T11:48:14.989776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:15c9dd92e98e7eac888f6d7ae1c94a73ba2c03663da791ec4e39d7fe45f49ad3","observation_id":"18da38ba-8842-46f5-a654-b8adc6741fc5","resolution":{"observed_at":"2026-05-21T07:59:50.533259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2606.01022","last_updated":"2026-05-31T05:25:14Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:25:14Z","title":"ProductWebGen: Benchmarking Multimodal Product Webpage Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:26:44.297446Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2606.01022"},"observation_digest":"sha256:6d2f3880e56606677780aaf868eaa77bc5b6d1d70f148a06e5867afa254e98ba","observation_id":"fc274802-491c-4c43-a684-3257e5aeeccf","resolution":{"observed_at":"2026-07-01T21:06:14.774423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-12T20:04:25.886330Z","title":"Ovis-u1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05172","last_updated":"2026-04-16T08:05:42Z","snapshot_observed_at":"2026-08-14T03:18:56.685775Z","submitted_at":"2026-04-16T08:05:42Z","title":"Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T20:04:25.886330Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2606.05172"},"observation_digest":"sha256:4d552d14ccbfd2c95210f55b09ed128b7a4bdf8ed5719d98913c5b61eeb54e66","observation_id":"02cbe20d-9d72-462f-b43a-dd01b43dd8d6","resolution":{"observed_at":"2026-07-12T20:04:25.886330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2606.13679","last_updated":"2026-06-11T17:59:50Z","snapshot_observed_at":"2026-08-12T10:38:27.260916Z","submitted_at":"2026-06-11T17:59:50Z","title":"InterleaveThinker: Reinforcing Agentic Interleaved Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T06:42:34.126336Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2606.13679"},"observation_digest":"sha256:e329d5891ac5a0071cc0e72ba645dce5f3e7b540ddaf3ff25848966c2ab665cb","observation_id":"1aa08193-def3-42b2-85cf-1652be0eb18c","resolution":{"observed_at":"2026-07-03T15:08:32.893829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-08-17T04:58:30.005341Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:eaf897a86f1a08ae86009bbc53ee28db9b8c6b4366cf55594d40a393b80e53fd","observation_id":"86578b31-29d0-469b-b3f0-e0c6be404263","resolution":{"observed_at":"2026-07-04T00:39:17.483974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-02T06:14:04.110103Z","title":"Ovis-u1 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-21T05:25:48.310015Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:04.110103Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:d46af12b529667bae78ecf08de51b253b7a3d38747121129ffdfd7d162e1a433","observation_id":"ee6c667c-5e32-4925-b143-4c580b0bc9b1","resolution":{"observed_at":"2026-08-02T06:14:04.110103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-01T16:12:23.583355Z","title":"2506.23044 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18091","last_updated":"2026-07-20T15:55:33Z","snapshot_observed_at":"2026-08-12T20:16:10.788109Z","submitted_at":"2026-07-20T15:55:33Z","title":"SciForma: Structure-Faithful Generation of Scientific Diagrams","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:12:23.583355Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2607.18091"},"observation_digest":"sha256:1caeaf90a9c381ab1062bebf35df89cc26b628963f42b1688dfe2a525b74cdb8","observation_id":"85c6cb5c-2878-4b36-bba8-fc6a7f6c33e4","resolution":{"observed_at":"2026-08-01T16:12:23.583355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-01T13:39:02.846343Z","title":"Ovis-u1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-19T05:52:04.295365Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:02.846343Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:c6da2fbf568074a0a860e8fd2f803e77b1af47476420f6ccd662f71e7f8c8543","observation_id":"7feddf75-2d9c-4cbd-9b90-0bcd4e1bda71","resolution":{"observed_at":"2026-08-01T13:39:02.846343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-31T06:20:13.828990Z","title":"Ovis-u1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-15T01:08:05.619745Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.828990Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:fd5e683f0aa98ea9dcb6568d8382afe5065cc271f58086807d35c51aec07da30","observation_id":"67dbe261-a3d7-43e7-9ac1-134dc8cd0f8f","resolution":{"observed_at":"2026-07-31T06:20:13.828990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-01T01:51:50.260499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25642","last_updated":"2026-07-28T12:27:59Z","snapshot_observed_at":"2026-08-17T19:12:17.658356Z","submitted_at":"2026-07-28T12:27:59Z","title":"Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T01:51:50.260499Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2607.25642"},"observation_digest":"sha256:d5c6642b80e346ec9efa31649260056d132d61d66823d75d95683567667880b5","observation_id":"808d42c2-22d5-4d08-a6a9-fbfcffebc0da","resolution":{"observed_at":"2026-08-01T01:51:50.260499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-06T11:55:28.131719Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.131719Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:6092f180c2e0ce82b7bbed5dbbca12885aca22604ce53932d73404cd6f151b17","observation_id":"cbf59592-eca8-4bfc-9597-a5d824d2a55b","resolution":{"observed_at":"2026-08-06T11:55:28.131719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-08T17:08:56.261632Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.261632Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:6bf9a09604de3c9a7047fc8377187e6e35542e68ad480791a5d5e31964b60fc9","observation_id":"d1086410-3241-4a04-985b-2c38ff909417","resolution":{"observed_at":"2026-08-08T17:08:56.261632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-14T04:35:00.046640Z","title":"Ovis-u1 technical report.arXiv preprint arXiv:2506.23044,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08676","last_updated":"2026-08-09T12:46:56Z","snapshot_observed_at":"2026-08-21T10:52:33.292138Z","submitted_at":"2026-08-09T12:46:56Z","title":"UniSpace: Unified Visual Representation and Scalable Multimodal Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:00.046640Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.08676"},"observation_digest":"sha256:d600b98cbaa3233b1da113c0798aaa989b42e4eb90cce601def525a090d989db","observation_id":"23ad3e4c-6cc5-435c-ad12-8a2e9c55ece3","resolution":{"observed_at":"2026-08-14T04:35:00.046640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-16T00:31:05.911595Z","title":"Ovis-u1 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11907","last_updated":"2026-08-20T16:45:02Z","snapshot_observed_at":"2026-08-21T10:23:54.761181Z","submitted_at":"2026-08-12T10:35:52Z","title":"A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:31:05.911595Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2608.11907"},"observation_digest":"sha256:0dfd981df77f33535ab25f10038e83a977388db29a918c24591aa6936fbd5ce6","observation_id":"3f9d7d50-5a78-435e-817c-0e09c284d389","resolution":{"observed_at":"2026-08-16T00:31:05.911595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23044/citation-record","integrity":"/paper/2506.23044/integrity","json":"/paper/2506.23044/citation-record.json","paper":"/paper/2506.23044"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:01:18.890898Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:18.890898Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:04e415142cfb78a893760d8371c679776fb62c97da47b34f72b962b349733590","observation_id":"b1f26940-a111-4509-9044-f93b68e15997","resolution":{"observed_at":"2026-08-06T22:01:18.890898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02471","last_updated":"2025-06-13T03:49:59Z","snapshot_observed_at":"2026-08-17T07:24:53.039261Z","submitted_at":"2025-05-05T08:56:12Z","title":"Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02471","snapshot_observed_at":"2026-08-06T22:01:19.342279Z","title":"Ming-Lite-Uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.342279Z"},"links":{"cited_paper":"/paper/2505.02471","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e357c9c1b3ecf3357ed06b0a2968e45ca921dc45b479e0442ecdf9e10decb625","observation_id":"1dee3b2c-2436-46d1-b713-42165f67ae27","resolution":{"observed_at":"2026-08-06T22:01:19.342279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T22:01:19.699701Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.699701Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:3149da069e50ce538383a3a01d0a859cee90707882482abb9e9aa821b1e7cfe8","observation_id":"bfebae62-49c6-4f63-9b2a-40380c2b9677","resolution":{"observed_at":"2026-08-06T22:01:19.699701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.759372Z","title":"Generating multi-image synthetic data for text-to-image customization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.759372Z"},"links":{"citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:c70e2ad308d8f454a13c3b64e7f0a9db3eba3581d7b67f714f6472953e3810e6","observation_id":"a7f30d90-fd70-4685-adca-9ceaab2d380d","resolution":{"observed_at":"2026-08-06T22:01:19.759372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-06T22:01:19.838068Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.838068Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:c79c38c370554c6731d00f12e147e267637494368489b63aff1c7cd37dc42885","observation_id":"ff295d1e-38c2-4eb2-8bb2-3530cd5c1afd","resolution":{"observed_at":"2026-08-06T22:01:19.838068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-06T22:01:19.948503Z","title":"UniWorld: High-resolution semantic encoders for unified visual understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.948503Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:f4a74a819ad0d76f26ebc42d8310c4f269ef544bff2b27f4b521bd41d6c668c2","observation_id":"b1c27ebc-14f2-4f97-ba9e-1b17c909838e","resolution":{"observed_at":"2026-08-06T22:01:19.948503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-06T22:01:20.117456Z","title":"Step1X-Edit: A practical framework for general image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.117456Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e22a2656efd8be3d5d086bce7174a5e5b740cdbbdba286718ec46e4383d7cd36","observation_id":"de2cc211-29d7-4ada-92a8-c56fefde7204","resolution":{"observed_at":"2026-08-06T22:01:20.117456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T22:01:20.236642Z","title":"MMbench: Is your multi-modal model an all-around player? In European conference on computer vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.236642Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e483da767dba6e30702cc7a9c6a15308c4cefecd5eb359e23e8ef5c182c56ba9","observation_id":"6966aa3f-f1fa-4f2b-9869-9325d6035023","resolution":{"observed_at":"2026-08-06T22:01:20.236642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T22:01:20.362999Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.362999Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:d8a6ff5e797365c2486cef370d6f116375c97c84b0e9773645e00fafae66b128","observation_id":"2aad56e1-aa05-4038-b813-07d979938afa","resolution":{"observed_at":"2026-08-06T22:01:20.362999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11831","last_updated":"2024-12-05T04:06:09Z","snapshot_observed_at":"2026-08-16T13:42:07.744224Z","submitted_at":"2024-06-17T17:59:43Z","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11831","snapshot_observed_at":"2026-08-06T22:01:20.485201Z","title":"Exploring the role of large language models in prompt encoding for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.485201Z"},"links":{"cited_paper":"/paper/2406.11831","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:afda09e0426d5d45e422b0bbab7e5a7fef2e4d9ca23f9c28501ee0687ae0766b","observation_id":"a4c83747-2718-486e-b673-aa6780cd42c5","resolution":{"observed_at":"2026-08-06T22:01:20.485201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-12T17:19:10.028618Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-06T22:01:20.775908Z","title":"Ominicontrol: Minimal and universal control for diffusion transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.775908Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:140f3ccbf1036ce379a92ee0467c0fc6c461fb535c2e739f748a4801e2b6e555","observation_id":"832f4d8a-2664-4068-8465-4905474e6b9b","resolution":{"observed_at":"2026-08-06T22:01:20.775908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:01:20.910350Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.910350Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e3f063132ed7e775c822879272c3c47280ec1b152d43c42985a030b8f129a433","observation_id":"19406f29-e030-43b2-a19e-d4750f808bb6","resolution":{"observed_at":"2026-08-06T22:01:20.910350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-06T22:01:20.967384Z","title":"OmniGen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.967384Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:3da0a2a4d0eb1520c39dbafbf2dfba8a39f1b0b3dfd28aa27fcccc0e81e29ae5","observation_id":"df0d8873-5fd2-4ce5-9671-a01b95f3a8e0","resolution":{"observed_at":"2026-08-06T22:01:20.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:01:21.047190Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.047190Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:8c62bbc88abbf1c2f5965fd0f794fc94adf3e9eab4437182ea6707b74f315d6e","observation_id":"8cf80178-8f4f-4ce6-b773-27d2b2e069ee","resolution":{"observed_at":"2026-08-06T22:01:21.047190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T22:01:21.141916Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.141916Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:087351aa337c95e1ae1b60cb9360fff21e0794ea16804d7f25a10637093ac7ec","observation_id":"f6b919d7-06ec-46af-943d-2ae1d285fe96","resolution":{"observed_at":"2026-08-06T22:01:21.141916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-06T22:01:21.241209Z","title":"Imgedit: A unified image editing dataset and benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.241209Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:eeda9024013ce1a0ade590671c01898c69e10e6150eba3a7d82e11fe6d3d3b1f","observation_id":"34755a93-0a9f-4799-a54b-94c234da339c","resolution":{"observed_at":"2026-08-06T22:01:21.241209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.423644Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.423644Z"},"links":{"citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:954adfa99018945ad452d242ca8266a22db1e71569402114f3996380724f5940","observation_id":"37e62b70-b871-4fba-8415-04f74c3b61b2","resolution":{"observed_at":"2026-08-06T22:01:21.423644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:01:21.610269Z","title":"InternVL3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.610269Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:b4adb18f8b3bd8be1a13b8b763c9137df71a531c4b4bc45ae5fbc536905e22cc","observation_id":"27412aec-328a-47fb-9fbc-581d57699664","resolution":{"observed_at":"2026-08-06T22:01:21.610269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-20T02:31:55.947510Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-06T22:01:19.198105Z","title":"Seed-data-edit technical report: A hybrid dataset for instructional image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.198105Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:3af9c58d6ab8f6838f05579a54f1c360719091543191b4bfd2d7fc2214dffebd","observation_id":"1f4da6bf-77e9-4a35-829a-8cbaf1ad1744","resolution":{"observed_at":"2026-08-06T22:01:19.198105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-16T15:31:56.064530Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T22:01:20.596851Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.596851Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:81fd10cb5fa9b8da960aac0de45d3b57253d3aa4a6b0adb0414ac47d0af2db3b","observation_id":"b14cbdff-083d-445e-8ddb-7ce25a85e739","resolution":{"observed_at":"2026-08-06T22:01:20.596851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12154","last_updated":"2024-12-15T15:31:56Z","snapshot_observed_at":"2026-08-19T22:37:08.377345Z","submitted_at":"2024-04-18T12:58:55Z","title":"StyleBooth: Image Style Editing with Multimodal Instruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12154","snapshot_observed_at":"2026-08-06T22:01:19.476640Z","title":"Stylebooth: Image style editing with multimodal instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.476640Z"},"links":{"cited_paper":"/paper/2404.12154","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e7de91610511169a849d56b2897637764b4b597df170a8d91a92de0b5f394d11","observation_id":"e0cc0b9b-74db-4cd5-b9c9-2db2a0241973","resolution":{"observed_at":"2026-08-06T22:01:19.476640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T22:01:19.522547Z","title":"EllA: Equip diffusion models with LLM for enhanced semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.522547Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:35dd3e508170c483c27338fc117d8d5fd1e0169fabdfd5d1da89947060c9a474","observation_id":"7fffe3c9-409d-4de7-ae26-296c0c759451","resolution":{"observed_at":"2026-08-06T22:01:19.522547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-06T22:01:18.962171Z","title":"Blip3-o: A family of fully open unified multimodal models- architecture, training and dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:18.962171Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:5e89da04bca577e0f733306f81b0185a5362765e52f71c5ffb53a3ae0316f58c","observation_id":"c54a4482-8029-4f7e-8993-d4e00c5153ac","resolution":{"observed_at":"2026-08-06T22:01:18.962171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-06T22:01:19.045935Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.045935Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:e62076cf0cf9cb7fcc2c8d1849d91c37664a3e4888fc1576f0532411523d6f67","observation_id":"99b5d5ba-653a-4696-b463-c2707af7e4f3","resolution":{"observed_at":"2026-08-06T22:01:19.045935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.054319Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"89d6bdac-88a3-4468-ae96-4de1b9cb73c2","year":2016},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.593095Z"},"links":{"citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:d22fe202a162a0bc7c0fb798db2d8c4111a1b868dcd25edbd6f54436812a1deb","observation_id":"0d02e96e-c3c7-4bd1-86f5-1a7e2fc38f73","resolution":{"observed_at":"2026-08-06T22:01:22.180016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-08-20T01:49:28.322849Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T22:01:19.113047Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:19.113047Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:99cc41b3cb45f4a657859d52ecf5b18925e31d5179060e204684d9243a878b69","observation_id":"cda295d1-e7e2-4768-962b-fe867de61575","resolution":{"observed_at":"2026-08-06T22:01:19.113047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 34 inbound Pith citation observations for arXiv:2506.23044."}