{"as_of":"2026-08-11T04:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:337f9f00521572b67d0dd0b40648c2ee4915e3d87c45a31e844310b0621c3e36","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:14:09.853239Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25527/citation-record","integrity":"/paper/2607.25527/integrity","json":"/paper/2607.25527/citation-record.json","paper":"/paper/2607.25527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-01T02:14:09.635442Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.635442Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a2abe7f0d8b09cd17b742a4747e90c0b1095df47709831a5d5f7c749d02298c8","observation_id":"6d822cfa-5d27-4f91-a107-d3382ffde034","resolution":{"observed_at":"2026-08-01T02:14:09.635442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.638491Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.638491Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a6fd77af8fb54c4c10e27f30786719d37ab322dca0a21dacaef49b943c25f729","observation_id":"b7668705-e96e-44ad-b5bf-5908ca006fa0","resolution":{"observed_at":"2026-08-01T02:14:09.638491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.640771Z","title":"OpenAI blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.640771Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:835c58a5be0aae6fb7901073113317d15814cd210faf7bd903c51bf82504588f","observation_id":"c5e68546-645f-4267-971d-1006b5f57955","resolution":{"observed_at":"2026-08-01T02:14:09.640771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T02:14:09.643040Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.643040Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:5d67bfa927016ba7ed6ebd31add21f970ce005aeddb3c594f00579c314c76bc9","observation_id":"1190516d-1a05-4d98-8c67-dd2a61529c8d","resolution":{"observed_at":"2026-08-01T02:14:09.643040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-01T02:14:09.645560Z","title":"arXiv preprint arXiv:2103.10360 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.645560Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:7d37efcd0ca433124c7d4f0e6c91497c642fc51d45599061924d7461d3725f01","observation_id":"917eec41-5b12-456a-a0d7-a0a1828968f7","resolution":{"observed_at":"2026-08-01T02:14:09.645560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T02:14:09.648170Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.648170Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:19478077d2ea54c00dcb0b59d071efe9d7c02259d98aa64cca884a1daa92db8d","observation_id":"bdfef975-41eb-4719-856a-2a56887ebb08","resolution":{"observed_at":"2026-08-01T02:14:09.648170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.650835Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.650835Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:856c88b3cf4bf71b1481cb2f64f2db142cbaadf4647d2c8a3b02ddd22fb83cb2","observation_id":"01db86fc-20f5-4feb-b9d3-ac4ecdf7f5bb","resolution":{"observed_at":"2026-08-01T02:14:09.650835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.653137Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.653137Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:1bb0d03b60869df3aa2ac2f5451dff4c7e072decea098bf8896f352884816129","observation_id":"59fe1502-9dad-4090-a301-104a6dd0583d","resolution":{"observed_at":"2026-08-01T02:14:09.653137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.655279Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.655279Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a0770d9f8bdb2cb8997696055b975149b7fad5cc9883b7458d17eb84b8963b12","observation_id":"5f4f585e-2efb-41d1-8ae3-8b82277da990","resolution":{"observed_at":"2026-08-01T02:14:09.655279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T02:14:09.657370Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.657370Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:7be124564ac003cb8ea685b21e21ae3584e23d3f744c9d43bd1e73f234cc9a79","observation_id":"b4963aa3-b34e-4146-80ad-30b776d668b0","resolution":{"observed_at":"2026-08-01T02:14:09.657370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-01T02:14:09.659839Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.659839Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:f72b6fdd5803bf903d91eb7af0619af20f284df2bf6ebfb65239ef7e897a0fb6","observation_id":"dfb57b7f-6ec7-44f0-bb3c-61f9bb92d819","resolution":{"observed_at":"2026-08-01T02:14:09.659839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-01T02:14:09.662243Z","title":"arXiv preprint arXiv:2504.10479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.662243Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:686605f62408752d6b44f1770fb3ba612071c1acb190477464f19dd6b002aee5","observation_id":"e9236777-6ac9-48e9-a2a6-e246e03ed9dc","resolution":{"observed_at":"2026-08-01T02:14:09.662243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-01T02:14:09.664298Z","title":"arXiv preprint arXiv:2403.05525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.664298Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:11d6907015960d731b5d04cf120362bca53398c1d788040eb9aadae19364d4f7","observation_id":"d57e628c-7ca7-420a-8eff-85740b4f658c","resolution":{"observed_at":"2026-08-01T02:14:09.664298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-01T02:14:09.666550Z","title":"arXiv preprint arXiv:2412.10302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.666550Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:464ee8be938439da4b6bbe6b820f35a6f67d9b08c1ce1fedd8bd179dced63f3f","observation_id":"cce9ad22-26cd-415c-afe4-39ddaa34608d","resolution":{"observed_at":"2026-08-01T02:14:09.666550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-01T02:14:09.668753Z","title":"arXiv preprint arXiv:2504.05299 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.668753Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:5ef6039b4d50a66d5fd6fcf2b0bbff91dcc7566f609d34cb64cf8138608f86cb","observation_id":"6f888a35-1279-4bec-b4ad-412d461792df","resolution":{"observed_at":"2026-08-01T02:14:09.668753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-01T02:14:09.670883Z","title":"arXiv preprint arXiv:2406.06525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.670883Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:03443d03fcad3eec7312f6a2dac1e565edf2e504020510e697a2acdd2f6dd889","observation_id":"8ab7e486-4f61-4e3f-bd85-d547503facae","resolution":{"observed_at":"2026-08-01T02:14:09.670883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-09T17:44:55.180658Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-01T02:14:09.672981Z","title":"arXiv preprint arXiv:2410.10812 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.672981Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:19c33360d6bbc6b74c46dbf2015ad9d6fdf2c131f88c442649f8e00cbba717c0","observation_id":"3f2abd4a-d34b-48c6-9f78-7247f82f084c","resolution":{"observed_at":"2026-08-01T02:14:09.672981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.675146Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.675146Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:c72dd70a36ef49efa7a98c504b5b1eca2417c8cbdbaf41ce7348fd9b401bda1b","observation_id":"a510151f-7821-4a04-b832-67c7e74bdf58","resolution":{"observed_at":"2026-08-01T02:14:09.675146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.677127Z","title":"Proceedings of machine learning and systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.677127Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:0ba360a677faa650eef4c0d02b2c4a9bb2a13cd9bd442528fa9fdbfe1677e7af","observation_id":"7b7b6e72-cbaf-434c-8104-8b61b00877cb","resolution":{"observed_at":"2026-08-01T02:14:09.677127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.679232Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.679232Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:be51c81551c6537358e228775d4250b9a234d7a56a28f18e5866d4db466b7a37","observation_id":"390f89a3-3abe-4bf9-92ed-d9f8115a6173","resolution":{"observed_at":"2026-08-01T02:14:09.679232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.681151Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.681151Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:5cecf9c761ce4f826707d4daa5a2f8d8d0a5e58815b1a67cc1b646d76d978369","observation_id":"a99611c5-82a4-41ab-b4af-91a3bd64e73b","resolution":{"observed_at":"2026-08-01T02:14:09.681151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-01T02:14:09.683080Z","title":"arXiv preprint arXiv:2409.04429 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.683080Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:dfa571a95ae4ff15e0b0ea48b224f35e38cb76eb3c4ca99e2fbac3d63454717a","observation_id":"3572b3f5-d612-404b-9db0-2e1c41d08a09","resolution":{"observed_at":"2026-08-01T02:14:09.683080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-01T02:14:09.685408Z","title":"arXiv preprint arXiv:2409.18869 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.685408Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:4004e2bec995f66165ec1ba21633e4cf51b98b2ef84bb9ace4324193e13c3b89","observation_id":"c01a7ccf-c41a-4012-907d-1d97ffd1e34d","resolution":{"observed_at":"2026-08-01T02:14:09.685408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-02T12:56:37.713692Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-01T02:14:09.687868Z","title":"arXiv preprint arXiv:2412.04332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.687868Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:d12583ac3f18e7c96509c624b94104a044d808a0fecdcecda31287c48192fabd","observation_id":"2ef15d77-cc04-4d18-80d0-a35ec502ee27","resolution":{"observed_at":"2026-08-01T02:14:09.687868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-06T23:12:29.776991Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-08-01T02:14:09.690130Z","title":"arXiv preprint arXiv:2506.18898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.690130Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9dd933a361b178b0829a1167e9cee0aba597ee7333b9ea6ca195a92844babc64","observation_id":"5376db81-4679-4749-aa0f-5ca47ef27479","resolution":{"observed_at":"2026-08-01T02:14:09.690130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.692456Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.692456Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:09edbe4919d145d0952016b9b5a6aa60a88f7430ec85e19e2f51e994c6d72ef9","observation_id":"9dec31d3-6546-4bb5-ba74-89a94bc7150c","resolution":{"observed_at":"2026-08-01T02:14:09.692456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.694503Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.694503Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:f23c8e26d5cb5561dfe0713e8a6025ce54da512cf7cd89626152005936c5b0ea","observation_id":"09fc30c7-4ae0-49fe-a82f-ab221e803c7e","resolution":{"observed_at":"2026-08-01T02:14:09.694503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.696645Z","title":"arXiv preprint arXiv:2502.20321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.696645Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9a8a9e7122f58d203912bd00687c2317347f3f3c326937d679ea9fe995aa67e4","observation_id":"4811978a-ff29-47f9-8f60-8cd71c995fc4","resolution":{"observed_at":"2026-08-01T02:14:09.696645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.699068Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.699068Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:c1c4dda9c76230d7652ccc0e2b06b113abbd917b410dae8878d78635c3f5ade9","observation_id":"b9238f48-ba38-4d02-8eed-10159ccc1c92","resolution":{"observed_at":"2026-08-01T02:14:09.699068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-01T02:14:09.701000Z","title":"arXiv preprint arXiv:2501.17811 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.701000Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:95266aa9ad20be5af9d238d3921eb5bb89514216079512c144322e7f39d19493","observation_id":"825332d0-8eb1-4b92-90d7-2ab865f844d6","resolution":{"observed_at":"2026-08-01T02:14:09.701000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.703243Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.703243Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:d2ed4b2340711e2e4612562932431bb90c05bf7b0335bb61ea42021a2b2c1783","observation_id":"d79baf54-52ee-4497-8cb1-01b3e01de288","resolution":{"observed_at":"2026-08-01T02:14:09.703243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.705509Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.705509Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:41ef51c0fcb0de0d8683edd0c6c7c1bf51c4cb05acad189b898714d4a4def13a","observation_id":"5c7c9a39-e79e-47da-9f4e-4c60089271f5","resolution":{"observed_at":"2026-08-01T02:14:09.705509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.707578Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.707578Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:4f05da45f7cc93cee671a575345c1060b3877283cdfc5f699f2fcf763e69c6f5","observation_id":"d574293c-b8ee-4008-a4cd-46ea9be80b7f","resolution":{"observed_at":"2026-08-01T02:14:09.707578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-01T02:14:09.709753Z","title":"arXiv preprint arXiv:2205.01917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.709753Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:d9e5e20a8d21115166c7395e3f91faac265a4d02b542bb844a63f690c20a1249","observation_id":"4be5d177-d5cd-4d79-aa4d-e7343b38925d","resolution":{"observed_at":"2026-08-01T02:14:09.709753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-08-01T02:14:09.712121Z","title":"arXiv preprint arXiv:2505.20147 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.712121Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:df902fcd18e4dd0b4b17dbe55b75b0f67295b242fd6e38fdadb4094d473b1455","observation_id":"cd52193b-2f7b-45d8-89dd-1614479348c3","resolution":{"observed_at":"2026-08-01T02:14:09.712121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.714236Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.714236Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:30804289947472c5cea3097b1778c70005179459ce849ca252077022e3200686","observation_id":"51904937-ec7c-4dab-b955-c80c59c6ae8a","resolution":{"observed_at":"2026-08-01T02:14:09.714236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23606","snapshot_observed_at":"2026-08-01T02:14:09.716304Z","title":"arXiv preprint arXiv:2505.23606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.716304Z"},"links":{"cited_paper":"/paper/2505.23606","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9b4b47d7cfeefc9f58f8bbcc77c2c8780c6ff381285b4c138670d6be078d7511","observation_id":"eb1b247c-ea41-4e4e-897d-d37491af8b77","resolution":{"observed_at":"2026-08-01T02:14:09.716304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.718770Z","title":"arXiv preprint arXiv:2503.10772 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.718770Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:936c3e42a1475acebfd1191bb0eb79b44c8eaf5317ea5e817435c7ce90ae9309","observation_id":"360da8aa-56a0-45c1-b85a-9c0d09b937dd","resolution":{"observed_at":"2026-08-01T02:14:09.718770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.720886Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.720886Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:0ce6a0cb978ddaee7306f4867c75c6d41110dbcaa4d1f76c40d36911e65c4535","observation_id":"b22f4a52-4331-4435-b897-eb0f9c897d3e","resolution":{"observed_at":"2026-08-01T02:14:09.720886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-01T02:14:09.722926Z","title":"arXiv preprint arXiv:2408.12528 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.722926Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:1d7b56d5f9713d7ffb10efe943d4fae86ed499d9364819ff14ce583bd2151a2c","observation_id":"2b968a28-79dc-4ea6-8983-bc194ac38dc9","resolution":{"observed_at":"2026-08-01T02:14:09.722926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-01T02:14:09.725080Z","title":"arXiv preprint arXiv:2506.15564 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.725080Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a26f06ad44cdf4a2aeac3f4e679f0b50b0b2e9067b847ce25e9031a69224bbae","observation_id":"a64a2dd6-6cd8-4ee7-b93b-1f0f9773476d","resolution":{"observed_at":"2026-08-01T02:14:09.725080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-01T02:14:09.727225Z","title":"arXiv preprint arXiv:2412.14164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.727225Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:6d76a0ee7b93a4727c37d5714be10daab482f4c7ddc5d1089b28b4e2dfeed48b","observation_id":"e20ba4f8-be2c-49fd-a6e7-27aa64fc3fa0","resolution":{"observed_at":"2026-08-01T02:14:09.727225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-01T02:14:09.729444Z","title":"arXiv preprint arXiv:2504.06256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.729444Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:90e6fb7e5cd9a2cef6e69c03a0ec74f621972dca05fb10b8dd13fa37811ac12f","observation_id":"9891d8fc-a98f-462e-bb44-7c0e6fce057c","resolution":{"observed_at":"2026-08-01T02:14:09.729444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-01T02:14:09.731512Z","title":"arXiv preprint arXiv:2405.09818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.731512Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:0ebf2dc82ce568734de753f4235ca4653750d93f845a1cf60606c7c82680b765","observation_id":"62dca7ef-37bf-4491-a82c-44c6e7582eac","resolution":{"observed_at":"2026-08-01T02:14:09.731512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-07-31T17:12:13.287514Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-01T02:14:09.733716Z","title":"arXiv preprint arXiv:2410.01756 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.733716Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:dcd328d57128a159c0a0ac68c16dab8a8b060eaba1127146e3cd995e06459bb4","observation_id":"fbe590f5-d3f7-4fde-81cd-e79630b097cd","resolution":{"observed_at":"2026-08-01T02:14:09.733716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.735764Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.735764Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:7bd99a2826b75aa09dfb07f4f7bac8cff896189522f77a758364c396fee46487","observation_id":"e646cae8-fff4-420a-97ea-8897560acc96","resolution":{"observed_at":"2026-08-01T02:14:09.735764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.738444Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.738444Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:706de4569fdc69dba3e968b09ed70be4d2bdc59e280f3b8b272e514e3ea29217","observation_id":"b3895f10-3282-42ed-948d-ac737497dd2c","resolution":{"observed_at":"2026-08-01T02:14:09.738444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.740667Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.740667Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:8dcad0571984307e6749c209352fdd430fbf6023594f125e449fd92e6a737867","observation_id":"a8be3992-5757-46b5-b975-1cf416216006","resolution":{"observed_at":"2026-08-01T02:14:09.740667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-01T02:14:09.742611Z","title":"arXiv preprint arXiv:2306.13394 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.742611Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:23f3d71a2d7301422f0995f8f756843e11fee34d2ab7f3ed7b8f0d2ca23a6bf5","observation_id":"47e8f753-f8c2-4325-9060-04229bb2a91f","resolution":{"observed_at":"2026-08-01T02:14:09.742611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.744773Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.744773Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:dbdb5af68c0b104243bb0db5fffcd9d3d0d63b67f9f9b01e3349a0e031663c63","observation_id":"63d19b94-950c-48c9-8380-44c9883d215d","resolution":{"observed_at":"2026-08-01T02:14:09.744773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.746753Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.746753Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:1e2ee7a12292c60c567a2132bb9b5bb290425c02b802e0d1524ba6aaa134365a","observation_id":"3042cbe0-f884-49ab-b783-7ae951a04795","resolution":{"observed_at":"2026-08-01T02:14:09.746753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.748873Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.748873Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:338e7e00238abbed261e1de4ea7678a7862857bc8c2335d0db7ce9dc6cb5ecfb","observation_id":"9a51c0b7-2270-4d22-a939-06e769077240","resolution":{"observed_at":"2026-08-01T02:14:09.748873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-01T02:14:09.750827Z","title":"arXiv preprint arXiv:2305.10355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.750827Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:cc560031eaed6ba9f6c742f04857ae4c5f51300388bc77b9bba2e627f9fcf4d1","observation_id":"90382785-b2a9-419e-af69-49a30189fd95","resolution":{"observed_at":"2026-08-01T02:14:09.750827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.753111Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.753111Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:094891ed29f8717ca44d6c85ac3a2309bcdcd1b153f2ba0c00720f6ffb394cb2","observation_id":"2294b431-5d8f-4bc8-88d9-2718a466ad2b","resolution":{"observed_at":"2026-08-01T02:14:09.753111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.755218Z","title":"Proceedings of the national academy of sciences , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.755218Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:47829d0fb395e145075f01d8ec8147cfa3ac3e23692dc299dad9e9d0ea665525","observation_id":"53cbad54-0881-452b-8e7a-872d784756ef","resolution":{"observed_at":"2026-08-01T02:14:09.755218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.757589Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.757589Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:db6760997faf16409886f20efca55cb1d0af3f93f646b3a84b95af22a0db9956","observation_id":"f1bf7fe7-9353-4b1f-94aa-08881026b2bb","resolution":{"observed_at":"2026-08-01T02:14:09.757589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.759988Z","title":"Proceedings of the 44th international ACM SIGIR conference on research and development in information retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.759988Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:575c9d05b92331c52b49cad04032e8f26014847c8368e5c9ea083628eaec7828","observation_id":"d5a2408c-9b0f-4f75-870d-63bfe10e646d","resolution":{"observed_at":"2026-08-01T02:14:09.759988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-01T02:14:09.761937Z","title":"arXiv preprint arXiv:2402.11684 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.761937Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:b04b1295389eb3082d9d07f1398a7745fa9b9b49e61b37e139391efddbf9b56e","observation_id":"ee0a4277-ee5e-4f3e-ba16-6697ec990925","resolution":{"observed_at":"2026-08-01T02:14:09.761937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-01T02:14:09.764129Z","title":"arXiv preprint arXiv:2403.18814 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.764129Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:e83a7ee4ebada968b55fb7ef07babc9a0a3e38599699c0cde06ba5bb8321a4ea","observation_id":"6a86ad0d-b695-40fb-a84b-960544069b0f","resolution":{"observed_at":"2026-08-01T02:14:09.764129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.766313Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.766313Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:64056b537aa6a17c4056082612b5d2d4b1341f97e9c613e41b63ed8d2d4fbbf4","observation_id":"4fe96f0f-d08f-42f0-a117-300e8b751b81","resolution":{"observed_at":"2026-08-01T02:14:09.766313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.768102Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.768102Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:43c246bd13d9107083af8f11b5d51b6009c7b828e351854087d29c267de6ecb4","observation_id":"ed34f350-5f97-4804-82a7-15386ea342bc","resolution":{"observed_at":"2026-08-01T02:14:09.768102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-01T02:14:09.770060Z","title":"arXiv preprint arXiv:2505.09568 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.770060Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a0c331b3f8f8604f5218df7ad59f01473eb1a0a20e7f9ddc73851ab8aa355d02","observation_id":"bc232d89-644f-46fc-a3e2-96cb6a617efd","resolution":{"observed_at":"2026-08-01T02:14:09.770060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T02:14:09.772449Z","title":"arXiv preprint arXiv:2508.09987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.772449Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:cd80aa5fe1e3b35678b88857e41ce360dc5a584ab4532d4f3237fa05b8ea6ef1","observation_id":"e6e8cc14-ba48-4b0f-8e93-6b5832611c76","resolution":{"observed_at":"2026-08-01T02:14:09.772449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.774589Z","title":"Proceedings of ACL , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.774589Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:664cf786c9f51e34dc1f61e0bf4b0b57d765db49706ad5367562d1778408e3a3","observation_id":"3b58d059-40fe-451f-935a-30723005f784","resolution":{"observed_at":"2026-08-01T02:14:09.774589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-04T19:36:09.411861Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-01T02:14:09.776624Z","title":"arXiv preprint arXiv:2210.14896 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.776624Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a0f94104e8bce670c77e33471bb1483312c5dbe8faa6395025193d4f03123c02","observation_id":"241528e2-3e44-46f6-b779-f58ec4a13e7e","resolution":{"observed_at":"2026-08-01T02:14:09.776624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-01T02:14:09.778827Z","title":"5: Three insights towards enhancing aesthetic quality in text-to-image generation , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.778827Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:6679b703dd8a45ceb6aa47100766994c996d787407ff4a3a9129afb5d3080b37","observation_id":"278f40d2-61ce-4b21-8027-3d91c2c439cb","resolution":{"observed_at":"2026-08-01T02:14:09.778827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.780943Z","title":"5 technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.780943Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:0439de482f49016296b7d521aa23bc5dc0356c59086c3b03b86aa96f370349ac","observation_id":"bc81e8e2-9b13-4857-809e-b78e8571c12f","resolution":{"observed_at":"2026-08-01T02:14:09.780943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.782823Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.782823Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:8882ccd362a1e2823b8639e2ea86e0b1eb15690e6dc0666dd162970eb6f341a9","observation_id":"3cd63f28-6d7a-480a-a040-80310a9154b8","resolution":{"observed_at":"2026-08-01T02:14:09.782823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.784756Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.784756Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:f62b0f23e9f3c146130fbb49daeb332376c592dfd35488f3fd10f7c5cacacd75","observation_id":"8feca1b1-55b9-4f77-832a-070719b648a4","resolution":{"observed_at":"2026-08-01T02:14:09.784756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.786607Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.786607Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:8afda2c8325d73df4fd0d9780ac4d3f329331b461eee753926215a1173234d42","observation_id":"203173a3-893b-4629-8c2f-147226f30496","resolution":{"observed_at":"2026-08-01T02:14:09.786607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-01T02:14:09.788866Z","title":"arXiv preprint arXiv:2505.15809 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.788866Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:2576b675176032741b27bb580c3315ea2550f952feea1230e030e44deafaa3a1","observation_id":"231c1717-8a8d-452d-8840-1cedb5534a6d","resolution":{"observed_at":"2026-08-01T02:14:09.788866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21979","last_updated":"2025-04-22T04:26:58Z","snapshot_observed_at":"2026-08-07T16:31:36.925232Z","submitted_at":"2025-03-27T20:50:38Z","title":"Harmonizing Visual Representations for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21979","snapshot_observed_at":"2026-08-01T02:14:09.791253Z","title":"arXiv preprint arXiv:2503.21979 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.791253Z"},"links":{"cited_paper":"/paper/2503.21979","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:2eaa7b1deb51da6d62bf7dc51800995836dea09fb99726bdb6e494956e030de9","observation_id":"e794fb98-3746-4095-a919-f93c121b53c6","resolution":{"observed_at":"2026-08-01T02:14:09.791253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17202","last_updated":"2025-06-20T17:52:31Z","snapshot_observed_at":"2026-08-06T23:28:33.159814Z","submitted_at":"2025-06-20T17:52:31Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17202","snapshot_observed_at":"2026-08-01T02:14:09.793608Z","title":"arXiv preprint arXiv:2506.17202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.793608Z"},"links":{"cited_paper":"/paper/2506.17202","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:4005b33ac4c694c170e85a1109581555f65205a4112901c7a739f318d54b51cf","observation_id":"c57f59f7-d39f-4680-ac51-a8ba07ad02bf","resolution":{"observed_at":"2026-08-01T02:14:09.793608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-01T02:14:09.795993Z","title":"arXiv preprint arXiv:2404.14396 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.795993Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:e424d7789642e5d3a3436c330b750a0c90c24787f5058f2bccb45fbdf90f281a","observation_id":"0cecab19-7a31-466c-968c-1ccc28564717","resolution":{"observed_at":"2026-08-01T02:14:09.795993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01934","last_updated":"2025-04-03T16:43:14Z","snapshot_observed_at":"2026-08-07T16:13:53.338367Z","submitted_at":"2025-04-02T17:45:00Z","title":"ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01934","snapshot_observed_at":"2026-08-01T02:14:09.798269Z","title":"arXiv preprint arXiv:2504.01934 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.798269Z"},"links":{"cited_paper":"/paper/2504.01934","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9482e9c0d6bde0420c23c7aafe15f6c45081d6e32a7e318e77eece620b3d3d0b","observation_id":"6b2073f1-f657-4d1f-9533-62ddf20c180d","resolution":{"observed_at":"2026-08-01T02:14:09.798269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.800492Z","title":"arXiv preprint arXiv:2309.04669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.800492Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:cb7745b5e55ed961cb553c9419e1e03379c4df6060b92cb640c2668513b9ed40","observation_id":"787f9f45-44db-44f2-84a9-f155bee2870d","resolution":{"observed_at":"2026-08-01T02:14:09.800492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.802506Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.802506Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:10b24bc4e0eb42d0437b64a7560108063da86196cdf012fb30a52005f395e93a","observation_id":"37aa285a-3d1e-409e-b0f2-380700a2578c","resolution":{"observed_at":"2026-08-01T02:14:09.802506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.804623Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.804623Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:c9fee3b2a7ef2d13e9f154a6f76c111dc061542221ac54a3808525430c5e28eb","observation_id":"4a159646-b2b4-4ac0-ad78-8e1b35836874","resolution":{"observed_at":"2026-08-01T02:14:09.804623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-01T02:14:09.806696Z","title":"arXiv preprint arXiv:2402.08268 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.806696Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9928adeb56e1ba7a11614be44b7ba386cfbef7edd23727ed53498b7d28caa70a","observation_id":"a19dabe8-8a04-4838-95b8-47275033b060","resolution":{"observed_at":"2026-08-01T02:14:09.806696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.808991Z","title":"arXiv preprint arXiv:2503.06764 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.808991Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:66141bc1dc8278b5b3ec94cc2868321fd56f722f0c2328d81eeeb1b1d65eaa36","observation_id":"4a1beea4-5392-4b8f-9918-fb76ac006b76","resolution":{"observed_at":"2026-08-01T02:14:09.808991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05422","last_updated":"2025-08-15T08:56:27Z","snapshot_observed_at":"2026-08-07T15:48:42.775075Z","submitted_at":"2025-05-08T17:12:19Z","title":"TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05422","snapshot_observed_at":"2026-08-01T02:14:09.811094Z","title":"arXiv preprint arXiv:2505.05422 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.811094Z"},"links":{"cited_paper":"/paper/2505.05422","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:919301de745ef6108e49f404ffff4f8001da1f059c67f9404d40010011ddd5f7","observation_id":"4112da53-a8be-491f-b95c-e48894b0801c","resolution":{"observed_at":"2026-08-01T02:14:09.811094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.813254Z","title":"Proceedings of the 1st International Workshop on Efficient Multimedia Computing under Limited , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.813254Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:9edd4b7ab2514a973ef27e3caac2d3f2bea9da821e93b1fbd409668e9d773b7c","observation_id":"13f9d1c7-3bd9-4927-a71c-8d41b2b8c2b1","resolution":{"observed_at":"2026-08-01T02:14:09.813254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-01T02:14:09.815337Z","title":"arXiv preprint arXiv:2402.03766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.815337Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:6b5f5b4734f1c62ef448b0df8feb964b4fd6da6058df00d0bc62a01e2bdab662","observation_id":"1fee9ea4-365d-4765-a35f-c423d3ef6543","resolution":{"observed_at":"2026-08-01T02:14:09.815337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-01T02:14:09.818128Z","title":"arXiv preprint arXiv:2312.16886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.818128Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:6e69b83aa6206d2924aa90de431dcb32e6db18939145e0adaeb33f2fe5643dcd","observation_id":"33549019-2312-4c34-9195-99dedf88e1c9","resolution":{"observed_at":"2026-08-01T02:14:09.818128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.820421Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.820421Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:bd36cabfffd4254517b8c393dbbf003bf37db891ece06120720a379f56654106","observation_id":"0b00afa8-409c-4857-87be-53d685216ede","resolution":{"observed_at":"2026-08-01T02:14:09.820421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.822478Z","title":"URL https://huggingface","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.822478Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a3364c56e1e75b8b4769aef352e79dd62001588ddf26c2c03cf7f88338c8ac30","observation_id":"c99377bf-fb3e-474a-95bd-ad2a3ed90afc","resolution":{"observed_at":"2026-08-01T02:14:09.822478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T02:14:09.824594Z","title":"arXiv preprint arXiv:2308.12966 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.824594Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:09499631efd9d9d9c8319f4a8960979e4d8acc2ae7d94540cfed1b6bbb74b3b4","observation_id":"039e9fa4-aebc-4199-beee-ffa5abe1efba","resolution":{"observed_at":"2026-08-01T02:14:09.824594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.826810Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.826810Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:79d32b17ae9ed7bc71310663a5cc557893bc08715082069e1fb96e5391018d60","observation_id":"71086539-402b-466c-92cf-78b7f6da92d6","resolution":{"observed_at":"2026-08-01T02:14:09.826810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-01T02:14:09.828909Z","title":"arXiv preprint arXiv:2204.06125 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.828909Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:3337d2b6dbf2caecccd305b1d421a32876a26267ec97ab2be34689859a5b9777","observation_id":"76c74b5a-c4b8-46c7-926c-96013cb82fe5","resolution":{"observed_at":"2026-08-01T02:14:09.828909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-01T02:14:09.831191Z","title":"arXiv preprint arXiv:2310.00426 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.831191Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:bccbfa0c43f7d36262d831d7a769c598e70e54e38b76ccce8d886d8cb3150b81","observation_id":"fa765995-4e6a-4e7e-a51d-9a80d5c5647f","resolution":{"observed_at":"2026-08-01T02:14:09.831191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-01T02:14:09.833278Z","title":"arXiv preprint arXiv:2307.01952 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.833278Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a4ababf9b818299f401a52a904cd14c283ff3a5336675cfc67019fc228dfbddf","observation_id":"a9489052-6c21-45e5-bd2a-197da020d181","resolution":{"observed_at":"2026-08-01T02:14:09.833278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.835632Z","title":"Computer Science","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.835632Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:08ab4952e68d9f6685926306caee7d9db18779c9b2743966813fdf0ebb03288d","observation_id":"fe323864-5202-45f9-b029-48da66092156","resolution":{"observed_at":"2026-08-01T02:14:09.835632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.837682Z","title":"Forty-first international conference on machine learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.837682Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:e307a997b086e35e2447ab699aaafca4103a6e23bc766df27d9c9f965854c93e","observation_id":"9a95067b-f562-4ca4-b9fa-91b0e3db2062","resolution":{"observed_at":"2026-08-01T02:14:09.837682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-01T02:14:09.839746Z","title":"arXiv preprint arXiv:2207.12598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.839746Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:3bcf365b42c3499038d1713c50fbfa02b7f485a33d16bc27279a4758539e1efb","observation_id":"e7f67f8a-bf49-47ce-9df6-2ebe5a186c8b","resolution":{"observed_at":"2026-08-01T02:14:09.839746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T02:14:09.841977Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.841977Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:676b3aea81ce463d69cc34fe5180a0d3528c4a45103cc99f16b0d6384f39a184","observation_id":"8e271c92-4cec-4a90-8e63-fdf8bca508e0","resolution":{"observed_at":"2026-08-01T02:14:09.841977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.844769Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.844769Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:cd13c7f47abbffc31ff771b96eef76693493821ba38dacee5224d3afd6942f07","observation_id":"8e949925-4cef-40f3-bf3f-8217bdd7cbdd","resolution":{"observed_at":"2026-08-01T02:14:09.844769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.847148Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.847148Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:a23f54ea2a8eea02ab080c973b45813a3dcd91997e12e7c350c561422058786b","observation_id":"4a9202ba-68e4-49f2-a0eb-4557b954c661","resolution":{"observed_at":"2026-08-01T02:14:09.847148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.849151Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.849151Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:4b50bd71b7a65b08bfb8c4776be3d113f730d00046debddeda043ead94413d73","observation_id":"d8d3bd69-52a7-444e-ba80-c18ca5de2e0b","resolution":{"observed_at":"2026-08-01T02:14:09.849151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:14:09.851223Z","title":"2024 , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.851223Z"},"links":{"citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:f7e807888a0379b33351a6d773e47abcd5f2c524984b7cb8e0ef2eabeeaa7c4f","observation_id":"f4daf8f9-2b65-4284-95f0-a1d6d5f0226c","resolution":{"observed_at":"2026-08-01T02:14:09.851223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-01T02:14:09.853239Z","title":"arXiv preprint arXiv:2210.02747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.853239Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:082660fa83fa163fdb2b7dcbf4e17942fdfb86cdea5e95a39f27f2d4f5218443","observation_id":"132aaca5-1c1c-41aa-86f7-28e0cdfde46d","resolution":{"observed_at":"2026-08-01T02:14:09.853239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2607.25527."}