{"as_of":"2026-08-09T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa5593be10dcc7d7af9a285e8db30f972deb63c478c3eb7650da2e80296b7fc0","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:32:32.091286Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T04:50:01.364000Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T04:50:53.692347Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2502.05415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05415","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o turbo: Towards accelerated unified multimodal understanding and generation","venue":null,"work_id":"7789d386-20a7-453a-b169-52eb1a6e77a4","year":2025},"citing_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-11T01:42:54.279353Z"},"links":{"cited_paper":"/paper/2502.05415","citing_paper":"/paper/2502.09992"},"observation_digest":"sha256:658ea3f58600d8b14f4ddc9128d88327bbc4cc0ee6a110eaeb02d327f927cc14","observation_id":"6c1abd88-de48-4b76-9c4e-e768c8a03ddf","resolution":{"observed_at":"2026-05-11T01:42:54.637399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2502.05415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05415","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o turbo: Towards accelerated unified multimodal understanding and generation","venue":null,"work_id":"7789d386-20a7-453a-b169-52eb1a6e77a4","year":2025},"citing_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T14:42:56.565621Z"},"links":{"cited_paper":"/paper/2502.05415","citing_paper":"/paper/2505.14362"},"observation_digest":"sha256:cb192f4c8374fedf60b1dee52457ddcec335564a210fe10f67061813ee12bcac","observation_id":"27cb4660-3136-4758-bd6b-81c5094cc310","resolution":{"observed_at":"2026-05-11T14:42:57.108742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"cited_work":{"arxiv_id":"2502.05415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05415","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-o turbo: Towards accelerated unified multimodal understanding and generation","venue":null,"work_id":"7789d386-20a7-453a-b169-52eb1a6e77a4","year":2025},"citing_paper":{"arxiv_id":"2510.20512","last_updated":"2026-04-10T07:55:17Z","snapshot_observed_at":"2026-07-06T22:33:53.834577Z","submitted_at":"2025-10-23T12:56:33Z","title":"Adversarial Concept Distillation for One-Step Diffusion Personalization","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-18T04:50:01.364000Z"},"links":{"cited_paper":"/paper/2502.05415","citing_paper":"/paper/2510.20512"},"observation_digest":"sha256:3f55f72732c2e7695dd454440e987ec5b0c89828d23710e4414026a413aa71d2","observation_id":"c40071c7-5406-4dd1-aded-3fdf24d131b2","resolution":{"observed_at":"2026-05-18T04:50:53.697000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05415/citation-record","integrity":"/paper/2502.05415/integrity","json":"/paper/2502.05415/citation-record.json","paper":"/paper/2502.05415"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.758583Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.758583Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:9722bdc5c18e92625af3a9cf2c8a84038308972c006fbef9353af47a41ea0214","observation_id":"f0d853e5-6e7e-4ad0-a0cf-cb73588cdd9c","resolution":{"observed_at":"2026-08-08T19:32:31.758583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:33.012896Z","title":"Meissonic: Revitalizing masked generative transformers for efficient high- resolution text-to-image synthesis","venue":null,"work_id":"56d9b5f6-e35b-4472-9a66-c520a3588e2d","year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.764015Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:995a205947df1f5bceaacb4bad3e5f8a756e2f5792a1a771c6ff24ebfbdc2ffc","observation_id":"81370336-c46c-44d0-b036-0c6841e1c9ea","resolution":{"observed_at":"2026-08-08T19:32:33.017870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-08T19:32:31.768624Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.768624Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:da97638141d853010b199d923b37a1be594f13e702de891fd34009e21425b2a6","observation_id":"660cb863-51a3-4175-9aff-4bcbcf7a17e1","resolution":{"observed_at":"2026-08-08T19:32:31.768624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.773644Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.773644Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:d2223979eb186d6ae96cb7a04808f4776661079f67064c5527c996207b64319d","observation_id":"8ba8980a-52ae-4ca7-a561-d16dfe2a572e","resolution":{"observed_at":"2026-08-08T19:32:31.773644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.778117Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.778117Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:40f2fe53c6999ec88facc9b76d7b636dec778d243f6335bb63617a26b55d371e","observation_id":"0de2ff5e-cf58-484e-bb1b-2f9b1e62810e","resolution":{"observed_at":"2026-08-08T19:32:31.778117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-08T19:32:31.782645Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.782645Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:f2a1b10eb80b93e21209c64b156c5a15033c25d774c559c978596a537e734f05","observation_id":"24e8bcc5-a1d0-4987-94ad-3c0953077f90","resolution":{"observed_at":"2026-08-08T19:32:31.782645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-08T19:32:31.787962Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.787962Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:87d4faf2a1ee7ebfba560b341374daaf50d26524d2191e139c366049ae31aee2","observation_id":"4b93af3c-892d-40ac-8a96-9a1069643208","resolution":{"observed_at":"2026-08-08T19:32:31.787962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-07T04:04:46.527670Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-08T19:32:31.792915Z","title":"Pixart- δ: Fast and controllable image generation with latent consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.792915Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:cc614b78ba3d64159fadfb737beae496d09d825626d2a218f0a28b8bc89e3e52","observation_id":"447310c9-9bc5-4483-a619-43fa9df5f104","resolution":{"observed_at":"2026-08-08T19:32:31.792915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-09T05:47:14.092221Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-08T19:32:31.797843Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.797843Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:ec058abb123f04ae4cf9492d088c86d886c209a362189347f0844f886f62b29f","observation_id":"2c6f69ac-a1d0-44e7-8f5a-a00b949aa260","resolution":{"observed_at":"2026-08-08T19:32:31.797843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.802454Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.802454Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:59517216af57f11e82e7643de3ecff92b60f4262fa4a056f839a186803eda77f","observation_id":"f2fef40c-a55f-42f0-ae25-362f1dcb8acc","resolution":{"observed_at":"2026-08-08T19:32:31.802454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-08T19:32:31.806550Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.806550Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:f9b3891267e8d19ef393b2cb731baf547c336ef29e3149acdccfdee90511fd27","observation_id":"32b8e202-2fec-44c2-b1d3-315b148233df","resolution":{"observed_at":"2026-08-08T19:32:31.806550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.811276Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.811276Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:3ef1740067de2b0c1b500991f0ca633b416b6cb52be470e8f5ef421fa0744705","observation_id":"b7f1a086-c2f6-48f2-b148-5bf3f1e9c6a0","resolution":{"observed_at":"2026-08-08T19:32:31.811276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-08T19:32:31.815634Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.815634Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:30f7909b15e08d00369b13af798ea8ecb9888e731117782f9851a4a56b6d1f94","observation_id":"deafb6bc-1dc2-4018-ad54-f99353b76ffe","resolution":{"observed_at":"2026-08-08T19:32:31.815634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-09T10:38:02.941912Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-08T19:32:31.820303Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.820303Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:fe8e367aaa10680f03d7e4e8ae12cff05b1275efb514eeba02098826172d8211","observation_id":"6fc7ee8d-a6bb-4657-924c-a52eb0d95681","resolution":{"observed_at":"2026-08-08T19:32:31.820303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-08T19:32:31.824667Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.824667Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:13f9289009aed3e5e1b3feed2e29f670699ca2feb6ab01a04c06c4f6ce2d4710","observation_id":"04b9c00b-afcd-4f63-99ff-6a1562670bb1","resolution":{"observed_at":"2026-08-08T19:32:31.824667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08709","last_updated":"2025-05-09T03:03:57Z","snapshot_observed_at":"2026-07-06T19:31:44.631136Z","submitted_at":"2024-10-11T10:53:03Z","title":"Distillation of Discrete Diffusion through Dimensional Correlations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08709","snapshot_observed_at":"2026-08-08T19:32:31.829284Z","title":"Distil- lation of discrete diffusion through dimensional correlations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.829284Z"},"links":{"cited_paper":"/paper/2410.08709","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:b626c4875854be9b705f959df6264f597c95e77c42901b93cdb22e861ea0c3bc","observation_id":"f4b9ecba-5e8e-4185-9508-22dd5d8ecb71","resolution":{"observed_at":"2026-08-08T19:32:31.829284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06807","last_updated":"2024-11-19T14:31:02Z","snapshot_observed_at":"2026-08-03T11:30:00.885783Z","submitted_at":"2024-03-11T15:26:34Z","title":"Multistep Consistency Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06807","snapshot_observed_at":"2026-08-08T19:32:31.834011Z","title":"Multistep consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.834011Z"},"links":{"cited_paper":"/paper/2403.06807","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:db41a4ff55ac625ffcf1c92273539a165332cd76a909ba128533add71f1da860","observation_id":"3970dfbc-d387-4fe7-ae33-5ac3a22f2475","resolution":{"observed_at":"2026-08-08T19:32:31.834011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T19:32:31.838794Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.838794Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:c6f236660adb3071c040340f2dacf34c2b51356b6546232335df8535dfa5aadd","observation_id":"e509b2e8-5a80-41aa-9ab3-49933a812192","resolution":{"observed_at":"2026-08-08T19:32:31.838794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.843547Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.843547Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:2a29441a0416416c3ffbd0dcbd9710bfa158e6933e1c4116db348a9b52064c56","observation_id":"6f439845-ce92-4046-b555-40aebbe79065","resolution":{"observed_at":"2026-08-08T19:32:31.843547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.848040Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.848040Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:abf94b74e00ea27cba8494a473d25f501f19d31a5eea7e338b6f8d67005f21be","observation_id":"2ec9ac62-e955-4cfd-b58b-fe558420c712","resolution":{"observed_at":"2026-08-08T19:32:31.848040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00835","last_updated":"2024-06-13T08:41:28Z","snapshot_observed_at":"2026-07-06T17:38:17.853302Z","submitted_at":"2024-02-28T20:17:04Z","title":"CLLMs: Consistency Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00835","snapshot_observed_at":"2026-08-08T19:32:31.852651Z","title":"Cllms: Consistency large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.852651Z"},"links":{"cited_paper":"/paper/2403.00835","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:90eb518cfef76c9361879e991e061dd9e524d8a639d9d8aebd22e88b9b97e7a8","observation_id":"904bd2c7-d05c-470d-8b50-5c64dbb4f304","resolution":{"observed_at":"2026-08-08T19:32:31.852651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-08-08T19:32:31.857081Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.857081Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:7f0ec800e2546da1cbc191b17830ee1fbfd94048fc1d54ac15d7cf100187d5fe","observation_id":"526fbf8b-d74f-470b-a624-48c9600b9ca7","resolution":{"observed_at":"2026-08-08T19:32:31.857081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T19:32:31.861883Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.861883Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:4da0c18bdfedeb3662cf4ae3aa0cdf315c047995b639e2fe0521e40689c4c5a3","observation_id":"9d9897c6-5d50-4db0-afda-4117e9e9b6bb","resolution":{"observed_at":"2026-08-08T19:32:31.861883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-08T19:32:31.866468Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.866468Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:da5f8b9fc2101f17ff498d5d32fc3bb0cb0a8b3d28756cd5e09a7f0bbd03c987","observation_id":"d51b8ec5-4492-4816-98c9-34dfbd9619af","resolution":{"observed_at":"2026-08-08T19:32:31.866468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-08T19:32:31.871239Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.871239Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:befed713d6fa798100f9288bafef616ded64e9b08436f862e33b62a1be615669","observation_id":"fbd23343-f99f-4090-a82f-8fe3ccfc52e2","resolution":{"observed_at":"2026-08-08T19:32:31.871239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-08T19:32:31.875847Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.875847Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:8281ec84daa04b2d0b30bb18b66d929aaf73d5593eb7c62532c306a9118097d5","observation_id":"8bc4c100-3750-4c4e-a460-f2075022732a","resolution":{"observed_at":"2026-08-08T19:32:31.875847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-08T19:32:31.880312Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.880312Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:8355057ff054658b9304e860dde2a60d3445c017e72709ef3525c69eafa8fc60","observation_id":"7338d1e5-19e6-4933-a70a-8ed36c5d9927","resolution":{"observed_at":"2026-08-08T19:32:31.880312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.884801Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.884801Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:81a37a38f0feebcb8db7ecfb2848193c3e3649f0fb9ac4d7411f45a1d0fa16fb","observation_id":"b9b81f87-738e-4787-8cfa-862e55dfb9b9","resolution":{"observed_at":"2026-08-08T19:32:31.884801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-08T19:32:31.888953Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.888953Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:15f26fd044e26ad03d889307126bb9a69dd402c9ad0d0753d5aa5e1ea661f19e","observation_id":"0c2adbeb-1897-479c-9aa0-3f3b135984a4","resolution":{"observed_at":"2026-08-08T19:32:31.888953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.893442Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.893442Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:62cd41b4147b51301cb69107ff1e1d70b82fb288d4715db60c661aace2ee702c","observation_id":"0bb7cda8-5ca1-4b95-b1e2-e0ae48961921","resolution":{"observed_at":"2026-08-08T19:32:31.893442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.897650Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.897650Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:5aedad13c6fc8fa892cbd3d798dd84a69ea583c9fee4dc5cf3e91fca0d441b7c","observation_id":"8a29e46c-953f-4a2e-a1d9-b7fc85736ce8","resolution":{"observed_at":"2026-08-08T19:32:31.897650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.901831Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.901831Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:fbe5136d45dda2fbfe86aec321bd9f4bee3ebddac59b111ed6ece9281e3ae514","observation_id":"9559d9d4-9dfe-43b9-9bb2-05b99a055959","resolution":{"observed_at":"2026-08-08T19:32:31.901831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.906235Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.906235Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:fc874830cbcac8e6a5f92055dff3085ee109506971b8fe25886dc9b344ba9996","observation_id":"99a115c1-da86-4fcd-898b-fb4d6056903f","resolution":{"observed_at":"2026-08-08T19:32:31.906235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.910383Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.910383Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:33de513e54fc852ebcacba7bd3183531f64e54acd4049f0e286561651bc13702","observation_id":"37b9de32-2054-4735-97c5-7001583a8849","resolution":{"observed_at":"2026-08-08T19:32:31.910383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-08T19:32:31.914446Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.914446Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:b9f081af33b94c328ed3e532f187bf86a9547a4a93bd039e7ff0c2fccfadda07","observation_id":"2b54b27c-9509-481b-a262-86094d3f6613","resolution":{"observed_at":"2026-08-08T19:32:31.914446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-08T19:32:31.919095Z","title":"Star: Scale-wise text-to-image generation via auto-regressive representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.919095Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:805d6a47a70ce574bd8eccf13f4ef280406c43116b35954d108fa240295d5238","observation_id":"154ef14f-8bb0-49d3-9d41-1c806bfbcb1e","resolution":{"observed_at":"2026-08-08T19:32:31.919095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-06T04:06:21.906356Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-08T19:32:31.923602Z","title":"Scaling up masked diffusion models on text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.923602Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:9037e1a82994c54f69677ec9151fabe87111c42ff3f9d24c42cc24a1004f8bcb","observation_id":"a53df81c-9326-421e-9334-7ba9ffc0be04","resolution":{"observed_at":"2026-08-08T19:32:31.923602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-08T19:32:31.928082Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.928082Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:71b29fe56bd2c68f07fd566db44e95a4950151b0d46f76a2aabf2f4e3a97dbb5","observation_id":"7ee81add-873a-445f-8cfa-5e4e30c60307","resolution":{"observed_at":"2026-08-08T19:32:31.928082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-08T19:32:31.932524Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.932524Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:d560637c5123fdf9050a3c76f98803e5f158cab87fd35249b7df8e2df6328860","observation_id":"faf83f71-33e7-400e-b8b6-2d18f7aba3c9","resolution":{"observed_at":"2026-08-08T19:32:31.932524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.936845Z","title":"Plummer, Liwei Wang, Christopher M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.936845Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:8a281d98e1c3dc0cb37a35cd41e9e96b2fd9a1fe56c29966d3b6b490037a6015","observation_id":"efdb6574-064c-41e5-96d3-6eaaf667541a","resolution":{"observed_at":"2026-08-08T19:32:31.936845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.885172Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"d1fa16b0-1404-474f-963e-776014986cdc","year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.941265Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:7f9f13645ec288da766c2113f8268551a5a17fe9d167d63db4a55828c482eb65","observation_id":"9439238b-6840-4291-b5e4-af7475faaf31","resolution":{"observed_at":"2026-08-08T19:32:32.889853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-08T19:32:31.945668Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.945668Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:7a0c03c08b5863c31f2b5f496faba6585d03e0df13d44e9476294cd92e8d7326","observation_id":"6f290ff0-26dc-4bc4-98f1-a88a07611163","resolution":{"observed_at":"2026-08-08T19:32:31.945668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13686","last_updated":"2024-11-04T13:24:18Z","snapshot_observed_at":"2026-08-04T05:24:37.569197Z","submitted_at":"2024-04-21T15:16:05Z","title":"Hyper-SD: Trajectory Segmented Consistency Model for Efficient Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13686","snapshot_observed_at":"2026-08-08T19:32:31.950210Z","title":"Hyper-sd: Trajectory segmented consistency model for efficient image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.950210Z"},"links":{"cited_paper":"/paper/2404.13686","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:a880a63f4c5ad5d7260f10c155a8857c6410fec6d98eb85d4743938d8fb08803","observation_id":"b15d7f19-78dc-4a73-b46e-59ace3e2603c","resolution":{"observed_at":"2026-08-08T19:32:31.950210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.954647Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.954647Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:033d5149456b6d59f11058d999869c7e1a8f614540bf86ea5f626d487f5dc3fe","observation_id":"d4414e88-df61-42a9-acea-b3fb5aba8644","resolution":{"observed_at":"2026-08-08T19:32:31.954647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:31.958916Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.958916Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:a810fc9b07ac082d5e66b31d54dc4834b4a5bfd12adab1f8f3a05c935397377f","observation_id":"ec808a2c-c23b-4aa9-ab1f-86ead260abe7","resolution":{"observed_at":"2026-08-08T19:32:31.958916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-08T19:32:31.963024Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.963024Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:6fd5038c279aa0875666b259a3592a09dc9e4d8cde38b52ddd204b7d9b193ebc","observation_id":"bca5b52d-d0b8-4121-bcde-b442ee225a54","resolution":{"observed_at":"2026-08-08T19:32:31.963024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-08-03T16:40:35.231838Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14189","snapshot_observed_at":"2026-08-08T19:32:31.967460Z","title":"Improved techniques for training consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.967460Z"},"links":{"cited_paper":"/paper/2310.14189","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:6d80d6f5ab6140fc3f58d340c312b55a69e21e02036c119e49d630df20c40aab","observation_id":"25ab360e-4429-41ae-a6ad-5a5080358342","resolution":{"observed_at":"2026-08-08T19:32:31.967460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-08T19:32:31.971891Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.971891Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:73e782687756e9552ac850224184f972619f7ba1fba945a797bfe9e78918c467","observation_id":"91f9e05f-97a1-40fe-b076-dcc217254a34","resolution":{"observed_at":"2026-08-08T19:32:31.971891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-08T19:32:31.976432Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.976432Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:3cb62edcd4259ea8befd92940b1f3cdd1f73865621928ee169e9d1f2d02691a2","observation_id":"fde81fc3-1829-4bcf-afa4-9d8fe87a585f","resolution":{"observed_at":"2026-08-08T19:32:31.976432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16750","last_updated":"2023-03-06T18:57:42Z","snapshot_observed_at":"2026-08-07T14:16:10.981980Z","submitted_at":"2022-11-30T05:33:29Z","title":"Score-based Continuous-time Discrete Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16750","snapshot_observed_at":"2026-08-08T19:32:31.980841Z","title":"Score-based continuous-time discrete diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.980841Z"},"links":{"cited_paper":"/paper/2211.16750","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:374541d848cb523c4cabd227871ebea7516239bc8da8921c9eb1f3f63fca61fb","observation_id":"da308618-fe28-4b9e-b2f2-a01872e681ec","resolution":{"observed_at":"2026-08-08T19:32:31.980841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T19:32:31.985055Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.985055Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:0f5b58c6249b009a0886b80f6a0517fbca98eac738d2d6bf199a44f6e9c9dd16","observation_id":"d944ede1-2ced-4366-a6b8-b905feae19c2","resolution":{"observed_at":"2026-08-08T19:32:31.985055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T19:32:31.994068Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.994068Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:ae22ca7d5871bb116973b5d1a42c883b4f0754f6f322b2323f138c724788ac55","observation_id":"f0445cb3-7820-40e6-b720-5805db2ee054","resolution":{"observed_at":"2026-08-08T19:32:31.994068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T19:32:31.998283Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.998283Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:b4e8be541afdd7ac42adf21a51ba5c6de12f63f5e07ae6d9ef83d9395cef1b13","observation_id":"e171689a-5604-40d0-858a-16ad27ff22a9","resolution":{"observed_at":"2026-08-08T19:32:31.998283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.002935Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.002935Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:0417e0d4fd4ad62d950b193d41a7eaeb185f210bd0978ed7a8791635b5152c87","observation_id":"cc2ea35a-8e48-4050-a500-c80da3423dc7","resolution":{"observed_at":"2026-08-08T19:32:32.002935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18407","last_updated":"2024-12-04T06:18:16Z","snapshot_observed_at":"2026-08-08T09:42:05.117152Z","submitted_at":"2024-05-28T17:47:19Z","title":"Phased Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18407","snapshot_observed_at":"2026-08-08T19:32:32.007195Z","title":"Phased consistency model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.007195Z"},"links":{"cited_paper":"/paper/2405.18407","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:0a87835e2ab4f089fae7bc5d4c641d1d6d326456fa4ed811924aa006398fb6b7","observation_id":"c3eb76dd-d6d1-4240-bc7e-ca7d8b745a8a","resolution":{"observed_at":"2026-08-08T19:32:32.007195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-08T19:32:32.011924Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.011924Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:9ebac0c1fd07dd4c29080954d4ca67c0e84cda632d08652d36efb362881ffe71","observation_id":"957c7356-cfe8-41d5-80ff-3173c2fa1573","resolution":{"observed_at":"2026-08-08T19:32:32.011924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-08T19:32:32.016320Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.016320Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:005bd29cbed5f9c81ecf02ac427cc0e6d2a78ba6d877236bda1c797eb171af35","observation_id":"b9955bfc-4bff-4a03-a99c-a5322c44cf4e","resolution":{"observed_at":"2026-08-08T19:32:32.016320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-08T19:32:32.021100Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.021100Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:0cea86b2cdf967b281ce728e9d5f42d64a4f456169904b26579778645d39367d","observation_id":"eec755af-05c5-4871-b90c-f65d67021776","resolution":{"observed_at":"2026-08-08T19:32:32.021100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-08T19:32:32.025426Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.025426Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:849fac7a669c73e49e4fb5d3b5992da6e3f11bc21b2f34f4efe3bc3cbb5d63c8","observation_id":"2637f880-89d3-4bf3-9d63-9a6f15a0c72a","resolution":{"observed_at":"2026-08-08T19:32:32.025426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-08T19:32:32.029916Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.029916Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:f258b834d899056039f4531b8cbf7b6d0808e6a9b5508bd793f4a747f4aa069c","observation_id":"d09d9d59-0121-4557-a18b-4f60abad04df","resolution":{"observed_at":"2026-08-08T19:32:32.029916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05768","last_updated":"2024-11-07T01:29:26Z","snapshot_observed_at":"2026-08-05T05:56:20.796228Z","submitted_at":"2024-06-09T12:55:50Z","title":"TLCM: Training-efficient Latent Consistency Model for Image Generation with 2-8 Steps","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05768","snapshot_observed_at":"2026-08-08T19:32:32.034210Z","title":"Mlcm: Multistep consistency distillation of latent diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.034210Z"},"links":{"cited_paper":"/paper/2406.05768","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:01967d8f5480073cae08ac02138ce73daf54888af8f54d01fefa56d8884a604d","observation_id":"47906f3b-9956-47f1-93f2-5695d6760804","resolution":{"observed_at":"2026-08-08T19:32:32.034210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.038683Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.038683Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:6184aeebc37444640b78737dbd202e6582e21764be6533cbfa55ff34465d70d2","observation_id":"c8dd303b-553f-4400-907f-4116e1dbe800","resolution":{"observed_at":"2026-08-08T19:32:32.038683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T19:32:32.048292Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.048292Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:2a5077845ed0579ed1f3d11221b8137e7bdcd6a3df88e6cc9569a33f526ca6bd","observation_id":"228f90ae-71d0-4972-859f-eaf95c1c2ce2","resolution":{"observed_at":"2026-08-08T19:32:32.048292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.052671Z","title":"Dream 7b, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.052671Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:9ff7a5b63fe2ce944a36f9be2b0e675015d1724532cf5b7dc033e0964e87dca4","observation_id":"e2fb8539-93e2-4302-a281-4b762bf26f5c","resolution":{"observed_at":"2026-08-08T19:32:32.052671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.824922Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"2af2cab8-80f7-49ae-946b-807de26899c5","year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.056762Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:e12da7b2cf43512168119fa5b32f88c757796aff73778e879d124a9ae07e6114","observation_id":"517edfec-b44d-4c4b-980b-8c2136a0a728","resolution":{"observed_at":"2026-08-08T19:32:32.831695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.061072Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions.TACL, 2:67–78, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.061072Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:1c9e02a488d2f450d644f451978c8f4a9bf44fe600d7ee4f973eae7777713d72","observation_id":"1a6e184c-5fbd-4ef6-8ca3-597789589df7","resolution":{"observed_at":"2026-08-08T19:32:32.061072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.065132Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.065132Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:51f13ffe15c17ae839a22be4f840f2f75040c5caeb9b1bc08e40c961fcacf588","observation_id":"f00eb8ad-2912-44e4-af1c-794378240ca5","resolution":{"observed_at":"2026-08-08T19:32:32.065132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:32:32.069403Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.069403Z"},"links":{"citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:11b3b2913589f37cf0c1b9ffd049ff7f62cc412bafbdf2f49d6346958d22e46e","observation_id":"f29aac15-1bc5-49c4-bd81-1bf84505ecd2","resolution":{"observed_at":"2026-08-08T19:32:32.069403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-08T06:16:42.503469Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-08T19:32:32.073558Z","title":"Monoformer: One transformer for both diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.073558Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:3d3ba2628808cf9b7382ff96db5f647afbdeb8dbf12673ad28ed8bcb47b2ca27","observation_id":"cdafda51-e48f-43b0-8445-fe23c13e09e6","resolution":{"observed_at":"2026-08-08T19:32:32.073558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19159","last_updated":"2024-04-15T13:51:17Z","snapshot_observed_at":"2026-08-04T12:42:29.134022Z","submitted_at":"2024-02-29T13:44:14Z","title":"Trajectory Consistency Distillation: Improved Latent Consistency Distillation by Semi-Linear Consistency Function with Trajectory Mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19159","snapshot_observed_at":"2026-08-08T19:32:32.077872Z","title":"Trajectory consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.077872Z"},"links":{"cited_paper":"/paper/2402.19159","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:d8fd0465c46f3e5698b40a6b704764bd5a89a1e32e6574f61389ec09268eed6c","observation_id":"2107e3c7-cfcc-4997-88dd-2b6d3c25a642","resolution":{"observed_at":"2026-08-08T19:32:32.077872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-08T19:32:32.082440Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.082440Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:4a12b591c9951362a9c018e209d8d29b50584b5a75ba7c95d0a165a396528c9a","observation_id":"d2777fa4-c676-4236-b850-1174e4de9cdd","resolution":{"observed_at":"2026-08-08T19:32:32.082440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T19:32:32.086866Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.086866Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:c3cdef21443577dc69b2af154711594b0113f7fcc30c126003fe3820fc597840","observation_id":"5a606780-af7b-4afa-af80-0f12f843693b","resolution":{"observed_at":"2026-08-08T19:32:32.086866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-01T18:43:37.910915Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-08T19:32:32.091286Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.091286Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:926d289b5fc28fef0769fc02e615f01c0d39988b659ea370a0446b5c5a050518","observation_id":"22b36fa5-7f81-4cef-a74a-5cb88c287ac6","resolution":{"observed_at":"2026-08-08T19:32:32.091286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-08-08T18:12:30.379068Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-08-08T19:32:32.042993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.042993Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:708f65a18ae6a95ecb2ce9e0d8451dc3ef87681d6e23941948b0afee75b9eb83","observation_id":"5b85435b-31ba-42f6-9292-a343ba9f3741","resolution":{"observed_at":"2026-08-08T19:32:32.042993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 3 inbound Pith citation observations for arXiv:2502.05415."}