{"as_of":"2026-08-08T13:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20858a7da8d564ed20ae706c60b4fbd78e0253d8d82a0fb9526145e20cabb89a","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:44:18.490290Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:10.728416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.706550Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-04T06:47:10.728416Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation.arXiv preprint arXiv:2508.09987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.728416Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:7c87e9ed54f3b670692924a7676bfce1bdb5ce08cbbc49e5ffa4f0d10cda3c08","observation_id":"930cac71-df1c-4ade-85a8-a73f533250b2","resolution":{"observed_at":"2026-08-04T06:47:10.728416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2512.07348","last_updated":"2026-04-28T10:02:14Z","snapshot_observed_at":"2026-08-06T12:32:11.849043Z","submitted_at":"2025-12-08T09:40:11Z","title":"MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T00:20:58.483350Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2512.07348"},"observation_digest":"sha256:4679234a70066383c6eb730efffd18a2f0067a55e01d83d21370068c1d469833","observation_id":"9077d993-71cf-4d75-a590-62ba585e9563","resolution":{"observed_at":"2026-05-17T00:21:23.408189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2602.01554","last_updated":"2026-04-06T03:39:20Z","snapshot_observed_at":"2026-08-02T23:52:41.711567Z","submitted_at":"2026-02-02T02:47:48Z","title":"InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:09:19.209759Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.01554"},"observation_digest":"sha256:07410d51ff4466e3040ea60c2ce0ed63dd8db7da216dbe20669abe424b46b39a","observation_id":"ee11affc-1452-4348-b2b3-13d6e7e85949","resolution":{"observed_at":"2026-05-16T08:10:45.467647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:00:22.875471Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:5af31dbcb144cb259d3cfe60f2425d5ac8c87734a19908040a7ec914e9f7582b","observation_id":"3727f093-580b-42bd-b965-57a7b0d45c8e","resolution":{"observed_at":"2026-05-21T13:04:10.562099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-03T03:50:46.874348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:46.874348Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:f9382d1f204a57822aa06e4ceccec1509aadaf6c634d28cd602c846cb93ee8d7","observation_id":"4b0d842f-3bb5-43bd-b628-7734f017fe59","resolution":{"observed_at":"2026-08-03T03:50:46.874348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-02T18:25:58.290824Z","title":"Echo-4o: Harnessing the power of gpt-4o synthetic images for improved image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-07T15:25:42.104111Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:58.290824Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:8eca86727ef2bb3ef566fd81f31e2154806f64c5fac0309fedf6af38617088c0","observation_id":"431cceef-dc42-4ef3-a2e3-06fdd4459c29","resolution":{"observed_at":"2026-08-02T18:25:58.290824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.17021","last_updated":"2026-04-18T15:09:01Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T15:09:01Z","title":"LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:41.483427Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.17021"},"observation_digest":"sha256:d638c2997f8a4ba4b311c3ec91fbf87d7c49e2e5d555803af416c66038de0f9c","observation_id":"87d8668a-d32e-40c4-b5ad-1c8834f1d5ef","resolution":{"observed_at":"2026-05-10T07:21:55.099717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.17736","last_updated":"2026-04-21T07:54:44Z","snapshot_observed_at":"2026-07-06T23:04:46.497227Z","submitted_at":"2026-04-20T02:49:32Z","title":"IncreFA: Breaking the Static Wall of Generative Model Attribution","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T05:35:46.381465Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.17736"},"observation_digest":"sha256:7853fd09b2bf5bfdd0be05e7aa2dd490232cf6b1c7b61e0b5a35598b7d6440a5","observation_id":"578ef19e-c334-4815-b475-25e8afa0b1a0","resolution":{"observed_at":"2026-05-10T05:36:01.504198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:e5d3cba93c9f05f391bcf7475b26dc4e3556b72a3ce917bed9123a9bc92bd7eb","observation_id":"3d432ef3-d8fb-47df-b223-a5d3b74ead1e","resolution":{"observed_at":"2026-05-10T09:28:39.636695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:773388dbc849ea680b1938b19d5e8ca880ec3975debb97f084b41d30a0fd65e6","observation_id":"3eec311c-890e-447f-aa40-f6e2275e829d","resolution":{"observed_at":"2026-05-10T00:49:48.357764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.02567","last_updated":"2026-05-04T13:19:18Z","snapshot_observed_at":"2026-08-01T04:32:00.116261Z","submitted_at":"2026-05-04T13:19:18Z","title":"Automated In-the-Wild Data Collection for Continual AI Generated Image Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:00:45.628715Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.02567"},"observation_digest":"sha256:6f137017926c457d985e84aad4b45be8fff5eb916b4bc0abd9e5de1d157fdda7","observation_id":"04c45296-5970-461d-b729-da28578ca476","resolution":{"observed_at":"2026-05-09T06:05:35.272848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:4e8a3e919a6f0821ea697f586819ec5b5b2e56b8bffa6ae625f89720aef1dfc1","observation_id":"a69c4dbc-3e41-46e2-8883-0988202182e8","resolution":{"observed_at":"2026-05-09T06:55:44.257603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:849578a04e1b1243b2a99d7263fe756c912cbc06086c900a81ae67486b313ace","observation_id":"e6f3e836-e3b6-44dd-b520-5a428ec346ac","resolution":{"observed_at":"2026-05-13T07:32:29.604208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:3ee2cc249e4b1f949b9c365d8be198e2c9de7140322ec0e2b2f028fa70724ef9","observation_id":"5a634008-15f1-4d99-9bdb-a99ff3c88d2d","resolution":{"observed_at":"2026-05-13T01:47:04.888423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:5ae13f52aa2106609632bc019dfb2d8bca4fc3297d5483e4c1aae4a9f07fce00","observation_id":"9cb5b6af-48b2-49d6-8066-3d516d37c56f","resolution":{"observed_at":"2026-05-13T06:02:23.959544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:5154856cae0fd78c9758e4f88a491c69d540ec41497e55fb30567ae1d9c6b542","observation_id":"8b878cdd-2cd2-48db-8273-c4b711f3440d","resolution":{"observed_at":"2026-05-14T22:03:03.420134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.12305","last_updated":"2026-05-12T15:54:49Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T15:54:49Z","title":"Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:48:04.997796Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.12305"},"observation_digest":"sha256:9c5ed018dee57361b233e6cf838ac51d99b06378b6e8aa622b3a0c27e3e3e88d","observation_id":"9f65ce3f-0c10-407a-ab3a-167a1e28387d","resolution":{"observed_at":"2026-05-13T05:52:22.717435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:06704b9b07b0c4ba1624bec66104062b59d8c7ceca7532f458d1dbea9633eea4","observation_id":"d80e7656-d23a-42e3-8b1d-56b62a9a65ae","resolution":{"observed_at":"2026-05-15T02:13:30.544636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:67a1cbd9a924a06dce1f8395b48c1accd17d43b53072f249c56978bef8c16256","observation_id":"7b84827b-75db-4d6c-856e-0c62ab14ec03","resolution":{"observed_at":"2026-05-19T16:37:39.705633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-02T11:48:01.614885Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:1cab156172f7a1c215a46d1ecaa4a8acbc6f3950026fea16bc434eaa58b94f6b","observation_id":"22edd390-9aec-43c3-90e6-85f988829d6e","resolution":{"observed_at":"2026-05-21T05:19:39.346678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.23518","last_updated":"2026-05-22T11:33:43Z","snapshot_observed_at":"2026-08-02T17:55:38.256248Z","submitted_at":"2026-05-22T11:33:43Z","title":"VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T04:21:05.811662Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.23518"},"observation_digest":"sha256:0486c861ed8b3c3d0bd0f88ff3f9768d67ac3e78bbae50a2fe91c553324a2eae","observation_id":"820dacfe-2939-4c1e-835f-8d8cdf1b3416","resolution":{"observed_at":"2026-05-25T04:25:19.730880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.30062","last_updated":"2026-05-28T15:13:31Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:13:31Z","title":"FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T07:59:44.436264Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.30062"},"observation_digest":"sha256:304a91328ffd99f35f3e4258cf5b40c781192ea0082728dbfb68eae408c23453","observation_id":"c0059742-8e6d-4142-a723-dbbc63bd864c","resolution":{"observed_at":"2026-06-29T08:03:14.105435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:54.292448Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.30248"},"observation_digest":"sha256:ac175056ef5c1d2b0e0da45ad8870fb8e7ac30f817db1b17c854c24f8721d08f","observation_id":"d90f1426-8151-49e6-9048-e1ba002e6484","resolution":{"observed_at":"2026-06-29T07:43:13.991999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.03243","last_updated":"2026-06-02T07:04:51Z","snapshot_observed_at":"2026-08-02T20:02:29.970136Z","submitted_at":"2026-06-02T07:04:51Z","title":"MemoGen: Can Past Experience Improve Future Text-to-Image Generation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:18.630777Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.03243"},"observation_digest":"sha256:6b6c0e464803d09a5896215f6b34a90496089183be1da8467f0ec18e6fd9bcd1","observation_id":"c4e0c9e5-a423-4714-88cd-6dd7da9438c5","resolution":{"observed_at":"2026-07-02T02:36:27.150642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.24849","last_updated":"2026-06-23T17:28:00Z","snapshot_observed_at":"2026-08-03T11:30:36.402988Z","submitted_at":"2026-06-23T17:28:00Z","title":"IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-26T00:19:49.071495Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.24849"},"observation_digest":"sha256:d61b49077b51116f09facf4b82899a651ecb57e260c6b15a8f3136d6d77c8245","observation_id":"abf57ffa-361c-4e17-9e30-b478241da339","resolution":{"observed_at":"2026-07-04T16:39:58.135045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-07T10:26:25.230801Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:8324dccf6bb7019c19e12354776299e74f307388f95c5baea8c42c37f31841a3","observation_id":"560ea876-8511-4e1e-867e-76970259df4b","resolution":{"observed_at":"2026-07-04T21:10:09.708346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:19:21.433049Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26907"},"observation_digest":"sha256:3cbc8c58d2e33afc2946346f9c9e1662923d4ed01b20d3d72afd245607e63290","observation_id":"f3feccb5-939d-4652-a186-3fb74814f15f","resolution":{"observed_at":"2026-07-04T13:19:50.702108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.26907","last_updated":"2026-06-26T14:10:09Z","snapshot_observed_at":"2026-08-07T03:18:39.904639Z","submitted_at":"2026-06-25T11:40:12Z","title":"Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:58:40.065005Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.26907"},"observation_digest":"sha256:48507fea9c2d319b46d159a6e9b845ca0422fd26abc0bb1c9e8399a81cea8dab","observation_id":"f665122f-5ab2-4958-a065-9e5e97710d82","resolution":{"observed_at":"2026-06-29T19:03:52.050125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:39b070db9b06875c06c3961eb4d1e1c233036fcccb9397356fda5bdec5756ed2","observation_id":"4bc666a7-0f71-40ba-82a3-fcba477715e7","resolution":{"observed_at":"2026-06-30T06:54:20.742715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:e82902d83b68a969d6b1734bab95064cd3ba9f4730eba13884d235f21d8af4cd","observation_id":"d10be50f-ff23-4c43-9fd5-9c5543cfb045","resolution":{"observed_at":"2026-07-01T10:05:40.288631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T22:47:42.650721Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15619","last_updated":"2026-07-20T04:43:29Z","snapshot_observed_at":"2026-08-06T18:01:16.811025Z","submitted_at":"2026-07-17T04:35:36Z","title":"StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T22:47:42.650721Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.15619"},"observation_digest":"sha256:1ee4f07df838474bc8561bc6dfb030f39b324251423898d04297f9ec5536fc0d","observation_id":"6d962e50-6fa4-47a8-9724-bb4ce6867b2d","resolution":{"observed_at":"2026-08-01T22:47:42.650721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T12:46:26.424119Z","title":"Ye, Y.; He, X.; Li, Z.; Yuan, S.; Yan, Z.; Hou, B.; Yuan, L.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19341","last_updated":"2026-07-21T17:59:02Z","snapshot_observed_at":"2026-08-06T18:17:26.869354Z","submitted_at":"2026-07-21T17:59:02Z","title":"ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T12:46:26.424119Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.19341"},"observation_digest":"sha256:cc8bac347d921fe9b3b85970143ce2e635a1299092d15a584f0cce0061dfd624","observation_id":"a22c9aec-68da-4707-8639-adf7a373f25f","resolution":{"observed_at":"2026-08-01T12:46:26.424119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-08-01T02:14:09.772449Z","title":"arXiv preprint arXiv:2508.09987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-07T06:54:02.373541Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.772449Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:49d6007296fc0b60f734bf72e76e78ee352ae1159e56e2b7c4c551c5bf75e8b0","observation_id":"e6e8cc14-ba48-4b0f-8e93-6b5832611c76","resolution":{"observed_at":"2026-08-01T02:14:09.772449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-30T18:58:28.496196Z","title":"arXiv preprint arXiv:2508.09987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26860","last_updated":"2026-07-29T12:44:19Z","snapshot_observed_at":"2026-08-06T09:28:43.159690Z","submitted_at":"2026-07-29T12:44:19Z","title":"Amortized Moment Matching for Visual Generation","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-30T18:58:28.496196Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2607.26860"},"observation_digest":"sha256:93793ca1b1fbda00b0e58790910bec4181ecf75ff1acf45e7b066882966c993c","observation_id":"e2f9fab1-341b-4ec4-b735-2dbbf7c15ceb","resolution":{"observed_at":"2026-07-30T18:58:28.496196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09987/citation-record","integrity":"/paper/2508.09987/integrity","json":"/paper/2508.09987/citation-record.json","paper":"/paper/2508.09987"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.478127Z","title":"Lawrence Zitnick, Devi Parikh, and Dhruv Batra","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.478127Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c8c6d419592ffdd821ac5a4e388522fc41d12250c4e10c11cb7d3eee5c6cd2df","observation_id":"8617fb45-85f5-4cac-b6d2-2f2376b89421","resolution":{"observed_at":"2026-08-05T20:44:10.478127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.536355Z","title":"Sd3-medium","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.536355Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a2342600de66cf4b8b19733c9c6d3f87a2ab81bd9fdcce69c2deb828ed4b9cfd","observation_id":"971a41a5-30bb-4562-b464-0237a213c23b","resolution":{"observed_at":"2026-08-05T20:44:10.536355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T20:44:10.622883Z","title":"Qwen technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.622883Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:dfcbd5b23d3955222d5f60dcbf519b04dbc0308501c4c5b8698a7aee9f909f2c","observation_id":"97555354-04a7-49f3-9c76-1e9d20533c84","resolution":{"observed_at":"2026-08-05T20:44:10.622883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:44:10.688300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.688300Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0b97a751a227b58446edf794c86996bbf835a58dbf9b6b51d5ea6abdcce03a0b","observation_id":"b99b6dda-b6a7-4f10-985a-3a24a173b7f9","resolution":{"observed_at":"2026-08-05T20:44:10.688300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.745556Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.745556Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d795db5d4c2d7d9e163ccd66b85765df9d13501df53072c226ebe58386dfe7d5","observation_id":"f773e167-5a88-44cd-be4e-e7ebc581fa0d","resolution":{"observed_at":"2026-08-05T20:44:10.745556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:10.827910Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.827910Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b0cb7a5d0e07d853a71d9984ecf42883ddb47c5c3c46e2fe9ddf3594360a493c","observation_id":"34d256f9-ab71-4f3d-a38d-cc6df7905906","resolution":{"observed_at":"2026-08-05T20:44:10.827910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-05T20:44:10.890407Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.890407Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6565e67d7f14b9b7336586074af6eb7f92f00b7fc53d39dacfc2cd9de84e748f","observation_id":"fb06e333-9da3-4435-ba91-0b2c8208054e","resolution":{"observed_at":"2026-08-05T20:44:10.890407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T20:44:10.965681Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.965681Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e815061d20abf30e37cce2b8e3f95d80555a0fcb54e1c19dd1cb332a594e1a9c","observation_id":"0a9f6bb9-d2f5-455e-8ebc-1323b3f2d242","resolution":{"observed_at":"2026-08-05T20:44:10.965681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T20:44:11.031053Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.031053Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f7e2f1011d7fbe63a0bbae454cddf2a4dcaf2ef3301b51d51f93a1b9549192b1","observation_id":"97a4601e-976b-4aee-a89a-3b446283c17c","resolution":{"observed_at":"2026-08-05T20:44:11.031053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T20:44:11.140230Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.140230Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6c166f86b99725eb2479ba3721447b9dc15558d988f0fc7f2956bcaff1630ce5","observation_id":"cc1c951d-86d4-43dc-88e6-8323404fe7e1","resolution":{"observed_at":"2026-08-05T20:44:11.140230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.209115Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.209115Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:176eaad29b8670a374a9c27b24d5a3a0ea2951785199572c4d3d18d048018e3a","observation_id":"a9b7a0c5-af64-46f3-9b24-bc9e6904c3cb","resolution":{"observed_at":"2026-08-05T20:44:11.209115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T20:44:11.307662Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.307662Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6324b5c10c2bdc10aedd46b29e59f1ba6d2e89fa96e0b54e0d4b532aaf5c6a7d","observation_id":"0413e382-52db-46f9-8719-9efc0395d285","resolution":{"observed_at":"2026-08-05T20:44:11.307662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.389528Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.389528Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0b108ef790198c22ac77c62948dcadf6cf0c70465ddfc23e11ef86c6888af2f5","observation_id":"669b36a1-b70e-4040-8632-c5031034c7f0","resolution":{"observed_at":"2026-08-05T20:44:11.389528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T20:44:11.474169Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.474169Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c32c5764a08dd9a1e77b981c5e4deb19824c9e0ec8d46087b891effce3186497","observation_id":"a496aa47-6186-4223-bf92-5645788ca429","resolution":{"observed_at":"2026-08-05T20:44:11.474169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T20:44:11.546425Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.546425Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:890053096c3289e228ce4896ae13a4a8da6baf575a638996ed89bad510c7ec94","observation_id":"e08b543a-3a34-488d-a6e8-45e8dd3a0fbf","resolution":{"observed_at":"2026-08-05T20:44:11.546425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-05T20:44:11.606456Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.606456Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d88abfb7dcf6218f3bf8145957de3494bfafe45720af15bd7a08cefd426df88b","observation_id":"2495bef3-5bb7-47dd-8736-453fa1f105bd","resolution":{"observed_at":"2026-08-05T20:44:11.606456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T20:44:11.699910Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.699910Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0399c2465015dbbc12b43391ffb289c97fd283196c2d76147e172ab26229af1b","observation_id":"21cde564-0d55-4a8e-a3ae-3cdf3dcd7b23","resolution":{"observed_at":"2026-08-05T20:44:11.699910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:11.819994Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.819994Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4a25a8113dd18346098fefe076c2291daabe3abf31d264afa14467a1787b903e","observation_id":"46ce3066-ded4-48b6-a4fc-a590c1e153e8","resolution":{"observed_at":"2026-08-05T20:44:11.819994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-08T12:14:46.815586Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-05T20:44:11.883278Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.883278Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2d21b37ba2d0b699fba68d216fca9d9497c87197183b7251771551300fe699df","observation_id":"013bb6d9-fef6-4856-a0fd-0524bf938b8f","resolution":{"observed_at":"2026-08-05T20:44:11.883278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:23.481318Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":"b5556207-68a4-4a0a-b929-fc2702347686","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:11.977252Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6ff30351f9f1420990fd8000c4c5b3217235a5e576dbdc853e425f704be3ab66","observation_id":"0c5d3d43-a58b-42ee-8789-60210e68f368","resolution":{"observed_at":"2026-08-05T20:44:23.523614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:12.088623Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.088623Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:9d57e62fcd4d4de30f30aa71e4eb3d9fcc021372784655ebf73075f333479e02","observation_id":"6f1fba65-6838-45c5-9b27-3fb226a9fba5","resolution":{"observed_at":"2026-08-05T20:44:12.088623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:23.278018Z","title":"Gemini 2.0 flash","venue":null,"work_id":"80504cd5-f8c0-4a6d-8a85-1c5e2019282b","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.163832Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e3b1e9569ab646548e14e3ff0ede0c7027750bedaad4ff564567dc4405d8b8b8","observation_id":"c8cae32e-ceaa-4ea0-aeb3-6c90f0bf8e42","resolution":{"observed_at":"2026-08-05T20:44:23.361409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:44:12.258440Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.258440Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3b2b509bca1deadef4071ffabf8466005649b72f35632e4ea58489e6888a8ba3","observation_id":"9254bbaa-5f05-4d51-bb8e-8dda23a2fa65","resolution":{"observed_at":"2026-08-05T20:44:12.258440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10529","last_updated":"2025-03-13T16:37:26Z","snapshot_observed_at":"2026-08-07T17:06:33.248223Z","submitted_at":"2025-03-13T16:37:26Z","title":"PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10529","snapshot_observed_at":"2026-08-05T20:44:12.369370Z","title":"Pisa: A self-augmented data engine and training strategy for 3d understanding with large models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.369370Z"},"links":{"cited_paper":"/paper/2503.10529","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:9966b2577f455e099a95cddebae0f53a4393135064c95258c3578d981aff1f9a","observation_id":"3cb084c7-d4b8-4bcc-b561-a4bbe46415cd","resolution":{"observed_at":"2026-08-05T20:44:12.369370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-05T20:44:12.432203Z","title":"Can we generate images with cot? let's verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.432203Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a912913996f43e84b2252d9bea8a2e0a6ee28cacf58423828418c742dfb81b5f","observation_id":"1c41b22a-8423-4dd8-9ff9-b14b3a0b11d8","resolution":{"observed_at":"2026-08-05T20:44:12.432203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T20:44:12.504055Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.504055Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c3c4f69751e0f8a62efba0f9edef0ce831d478785527fde8cdb404a06ea31a61","observation_id":"5ac129a1-469f-4d0e-8853-84325d4ba9fd","resolution":{"observed_at":"2026-08-05T20:44:12.504055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-05T20:44:12.564771Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.564771Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7ffbd95905bdc58a0b9aaea6c62e23e5621562aa59068eb9d614bb77037004f2","observation_id":"97dabc6a-db8a-40ef-beeb-1ff6075eb843","resolution":{"observed_at":"2026-08-05T20:44:12.564771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.941659Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"05006a0e-62ed-4680-adfe-fec0085da122","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.627331Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:62de5514d44af83962b6d7495bc9896cf9c33fb1187ae05975a99be9252a51dc","observation_id":"7a515664-b7a0-4767-a102-1e81076cb6f6","resolution":{"observed_at":"2026-08-05T20:44:23.131160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-05T20:44:12.680706Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.680706Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:dbd96eb95bed0c91c048f0267fd20c928c3967b38dc76a8835a3d1d0f0baf9c2","observation_id":"536242bd-79f5-4edf-b5cc-89f572b67e5e","resolution":{"observed_at":"2026-08-05T20:44:12.680706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03653","last_updated":"2024-11-27T09:55:41Z","snapshot_observed_at":"2026-07-06T17:55:49.302964Z","submitted_at":"2024-04-04T17:59:46Z","title":"CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03653","snapshot_observed_at":"2026-08-05T20:44:12.755158Z","title":"Comat: Aligning text-to-image diffusion model with image-to-text concept matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.755158Z"},"links":{"cited_paper":"/paper/2404.03653","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7f9d38d444669451db1bdc28e1bf300fe65a134f1074d12b01209e65ab009899","observation_id":"c7d45430-4670-46bf-abdf-01758b3f0373","resolution":{"observed_at":"2026-08-05T20:44:12.755158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-05T20:44:12.841584Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.841584Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fc092db350d7f64f4b608b900bb39033a1a33338c8f28f40991f731f7b8b9ba3","observation_id":"b065b8fc-0f30-42c5-adfa-00e05b1bc5f6","resolution":{"observed_at":"2026-08-05T20:44:12.841584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-05T20:44:12.948621Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:12.948621Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:90ee6f9c4b6974bf660fef36d3124ad5d79455e41ed9bfddd1d85536edb9f3c5","observation_id":"ac2ac4a8-37f7-4a10-9308-141a84c5d824","resolution":{"observed_at":"2026-08-05T20:44:12.948621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-07T20:46:02.743961Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-05T20:44:13.035019Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.035019Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:09dd800c5a96f1c2304779e7a37a13270fc5dd2a918d6cf84f30f17880e5f23e","observation_id":"537b8e27-1d48-45fe-9349-229f5710d9d2","resolution":{"observed_at":"2026-08-05T20:44:13.035019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T20:44:13.131965Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.131965Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:91cf2fcbbb1666703ce184d0a3e8924ea33d7fe67b8b66f1a95a034c0a39631c","observation_id":"eeee2d81-7577-4268-aec4-0d0e8cb0bc80","resolution":{"observed_at":"2026-08-05T20:44:13.131965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.239307Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.239307Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a911f5351a12f6db778094e50ba1715ee7bc07201f749f5f1ec8b9e9702c21b8","observation_id":"9f0e7380-5565-4469-8545-0d46e55d4818","resolution":{"observed_at":"2026-08-05T20:44:13.239307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.299556Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.299556Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:41b6f997d89531fe8a58a74072cff2f3d019b6fc4067912dedb6a952bf70e5db","observation_id":"d76b024a-e6ab-4322-a1b3-20081f7708fd","resolution":{"observed_at":"2026-08-05T20:44:13.299556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-05T20:44:13.367107Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.367107Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:08f46d18b125a8ac6a32f9fce7a0f5e4881089c44f2347e31f612db53b371f32","observation_id":"d33fa69b-7a28-4909-9114-fbebdc2da3be","resolution":{"observed_at":"2026-08-05T20:44:13.367107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14765","last_updated":"2024-08-27T03:41:44Z","snapshot_observed_at":"2026-08-06T11:14:38.844865Z","submitted_at":"2024-08-27T03:41:44Z","title":"CrossViewDiff: A Cross-View Diffusion Model for Satellite-to-Street View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14765","snapshot_observed_at":"2026-08-05T20:44:13.455328Z","title":"Crossviewdiff: A cross-view diffusion model for satellite-to-street view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.455328Z"},"links":{"cited_paper":"/paper/2408.14765","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:158ec981cb32d2e635e8ac9de92583a4f83d4083d8819b2813d9a29ec0d92f4a","observation_id":"e8fecf9f-ad82-47a4-839e-4c0e0c6197b2","resolution":{"observed_at":"2026-08-05T20:44:13.455328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T20:44:13.554546Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.554546Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:dff9d707856cde7edb359a5fce70c06088f0e1b2679a740dc45ddc4ad70c7df1","observation_id":"e7854012-5878-4145-a2f3-f0b127f40fdd","resolution":{"observed_at":"2026-08-05T20:44:13.554546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-05T20:44:13.670112Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.670112Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:43fc0ba33a5c1f917bbd57419d4890c8f6625d8e6b35b5db68762de0f12a8e52","observation_id":"1edcc029-c7a2-4424-9eaa-778cfe197606","resolution":{"observed_at":"2026-08-05T20:44:13.670112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:13.852362Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.852362Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c54fa021b9a820079d80918b40488999d9bf2ea74ff5a8a4f44ab4f64727ed33","observation_id":"96bb787e-a117-4b9c-b4d2-0490c681795f","resolution":{"observed_at":"2026-08-05T20:44:13.852362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-05T20:44:13.931759Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.931759Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:526b26a82a09bf40a4a4420dd75b93eb98cdd1a1946d469c0b563fa47ff9a365","observation_id":"15f05b24-c517-4cf2-a712-3970452c8e49","resolution":{"observed_at":"2026-08-05T20:44:13.931759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.625776Z","title":"Visual instruction tuning","venue":null,"work_id":"2f398aaf-f117-4a08-961b-584a034b70a7","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.038559Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0193a53c64efe34ad652cb2c4880754c4e643bfec58569dca701002a2dcd45ea","observation_id":"ef264d48-ff5c-4941-9c5c-0fde57f60077","resolution":{"observed_at":"2026-08-05T20:44:22.745660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.104263Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.104263Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f9d6e6585d4ac4e7b6bfb9b1674d7cd970ff18c3e1c49835dcdf9a4144cf8b09","observation_id":"b3b2deda-1d67-44f3-ae94-ec315b1903d6","resolution":{"observed_at":"2026-08-05T20:44:14.104263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T20:44:14.255400Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.255400Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d7823ff5ccb46c084468d0596b79c53bf803a57071721e33b9a1a75130f9f177","observation_id":"29b277f6-3478-4afb-b12d-ca87597a64cc","resolution":{"observed_at":"2026-08-05T20:44:14.255400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:44:14.390201Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.390201Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0819caeb1e69e94547932536ace83e89242b4718a5b1190cabb7b88c319d8ccb","observation_id":"b74d1110-41e6-40c1-9fd0-3fde59ad31c3","resolution":{"observed_at":"2026-08-05T20:44:14.390201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.465050Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.465050Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:ed7e4b55120c50054815b924c9931f87d22ebd2f53ffe9b4704cb2988b0bd60b","observation_id":"e491591a-c5fb-4ea4-9fb1-c8ef4e85a808","resolution":{"observed_at":"2026-08-05T20:44:14.465050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:44:14.544936Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.544936Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4ace57c391ff848ddf92eb0ed266cd58a198d6bc7d2d46995465b2c2eec394c5","observation_id":"8b0ca092-b47e-4b6a-b559-4a2cc6f71a60","resolution":{"observed_at":"2026-08-05T20:44:14.544936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:22.280795Z","title":"GPT-4V(ision) system card, 2023 c","venue":null,"work_id":"e620aa92-a5fd-4e57-90f0-edc1a3e4d931","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.654402Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:66202b58b728426dd480d40a4abca77438d8632066552033dce9292b8f397f74","observation_id":"6b7be0b3-184d-4b69-8eb5-b3ca8f3a3970","resolution":{"observed_at":"2026-08-05T20:44:22.415811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:14.813143Z","title":"Dall·e 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.813143Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:daadba4b8ae75ca57662ddfec35a19d45e4a1018daad1f18c724d09cd646abe8","observation_id":"700e44bb-11b0-4977-9a4b-b32311c363a4","resolution":{"observed_at":"2026-08-05T20:44:14.813143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.819827Z","title":null,"venue":null,"work_id":"82b0e0b8-5050-4360-8da5-0649c2a8123e","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:14.924248Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f08d9f6aa67bf3d5b9348caf77a2b4111f7a48bcc008f2ebabf926c1e87d4963","observation_id":"786b6bb7-1fe6-4836-9248-a1b61e0b8f3a","resolution":{"observed_at":"2026-08-05T20:44:22.066520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.512124Z","title":null,"venue":null,"work_id":"69aa880d-f23b-411d-a1cb-710843acf51d","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.018814Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7a66fd5376e05504771c1b1a630e7b75a7955ea5ca49f13b05f19cfef9f2378e","observation_id":"ce6d28a4-dd5a-4a0d-b3b8-3b3878bf56ec","resolution":{"observed_at":"2026-08-05T20:44:21.653553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-05T20:44:15.111083Z","title":"Transfer between modalities with metaqueries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.111083Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6f0c90f54a03dfc6e1ae9ac0b00912c0564e8e5be8f1cd09b663dba153116a44","observation_id":"bc58b3d3-28a5-44a2-9759-bd83c6352742","resolution":{"observed_at":"2026-08-05T20:44:15.111083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-05T20:44:15.208196Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.208196Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a43dce44f13117d2a71dbeae1f480b73e325457cca89938ba10f948163254d8d","observation_id":"1268b0aa-837c-497b-9fbd-7c962c5667d5","resolution":{"observed_at":"2026-08-05T20:44:15.208196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.240970Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"e0642074-3059-429d-a129-f1f7d6c0843b","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.342084Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:24aa441a23f8f3e0a5db110b9a677141532306335422604e7003b104b7f9d7bd","observation_id":"d626d2a7-e5f8-4924-b316-49e5c9a29f2b","resolution":{"observed_at":"2026-08-05T20:44:21.328873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T20:44:15.466929Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.466929Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a0ec858e467e4885b667091a9fa1cee4f4a356daae18be93849a42137766bf00","observation_id":"d4ce61b1-0977-44b7-943a-a93b7694132a","resolution":{"observed_at":"2026-08-05T20:44:15.466929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:15.560365Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.560365Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2fe0bde72b3b92ebf65ce1c25214ba200ae3a213274febcab1a2ba595f439785","observation_id":"1565b050-13d7-44d7-89b9-1d9e7d97a88b","resolution":{"observed_at":"2026-08-05T20:44:15.560365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:21.031699Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2bcc7b08-ccdc-42d1-912a-4e79c743db95","year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.634551Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:d35a40c18044bf948a419a4a5f2995065337c22e74ba62959354b8027fddf769","observation_id":"e043e2f4-65c6-4329-a8f4-45e308aabdc9","resolution":{"observed_at":"2026-08-05T20:44:21.096417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.852776Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"31434a76-1dcf-4318-be05-47401a385e06","year":2022},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.688147Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c28b38a8b18f2c0e9a97a74dce44d771e01a2f0c67d88740e87c7ea1bfa4965e","observation_id":"7e1b5794-57e4-43d6-ae34-5f736ffe59bc","resolution":{"observed_at":"2026-08-05T20:44:20.943984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:15.762368Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.762368Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:4aefa789416164c44092e8730944c593fbf3a9391d699ebe9428fe82a1ad3f41","observation_id":"86ca084c-fab6-4139-a63d-6d3ac42082a7","resolution":{"observed_at":"2026-08-05T20:44:15.762368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-05T20:44:15.870519Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.870519Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0360373a98af270eda950b324925b6e0adedfeba4e77c9a2ecd3fc6e35e57b3f","observation_id":"0751e862-9eb7-42f8-90f8-edd4ff0e57a6","resolution":{"observed_at":"2026-08-05T20:44:15.870519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:44:16.057133Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.057133Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b51fcfc07d36b3089d7211b7cac6dd783e9a6b58a165895f587a2367c75e6227","observation_id":"eec3108d-0d5d-42b9-8fe0-56002d0fe716","resolution":{"observed_at":"2026-08-05T20:44:16.057133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T20:44:16.154776Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.154776Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:56d88e0dd3529064e41662d0f7aea5c4581f03a98e078976a82a446230c1d7b2","observation_id":"2adcf704-cc20-496a-9476-b17d332f7b92","resolution":{"observed_at":"2026-08-05T20:44:16.154776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21033","last_updated":"2025-07-28T17:54:04Z","snapshot_observed_at":"2026-08-08T13:17:53.714491Z","submitted_at":"2025-07-28T17:54:04Z","title":"GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21033","snapshot_observed_at":"2026-08-05T20:44:16.254186Z","title":"Gpt-image-edit-1.5 m: A million-scale, gpt-generated image dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.254186Z"},"links":{"cited_paper":"/paper/2507.21033","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e60dc8957b90ebc7f56b6bc623b6ffb6a2252aeeb696dabd640b9e419230b7f1","observation_id":"ccef5db5-15eb-4134-9cfd-857a8cfa91a8","resolution":{"observed_at":"2026-08-05T20:44:16.254186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02161","last_updated":"2026-07-12T08:53:18Z","snapshot_observed_at":"2026-08-07T11:27:10.636069Z","submitted_at":"2025-06-02T18:44:07Z","title":"TIIF-Bench: How Does Your T2I Model Follow Your Instructions?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02161","snapshot_observed_at":"2026-08-05T20:44:16.332457Z","title":"Tiif-bench: How does your t2i model follow your instructions? arXiv preprint arXiv:2506.02161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.332457Z"},"links":{"cited_paper":"/paper/2506.02161","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:33db794a14fdf9eb1fdf50ca76bce0046c0ac702208ed40efa95a56e3dc3b8ff","observation_id":"31c843ec-e643-4c38-9c8d-3749a0c7960a","resolution":{"observed_at":"2026-08-05T20:44:16.332457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:16.378281Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.378281Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:99d26dbc58d953f0644674c23579669b075d375472989e5f43000322b6fb2e0c","observation_id":"b202c619-3cc5-410c-a751-e1392b7e1a01","resolution":{"observed_at":"2026-08-05T20:44:16.378281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-05T20:44:16.475472Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.475472Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b30828d1575cd3db52d205939eb4229d2cfb51a8d7cb51b805d5e819a160e2a0","observation_id":"276f6e35-9182-4dfc-a0df-9f322ea10bf2","resolution":{"observed_at":"2026-08-05T20:44:16.475472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02160","last_updated":"2025-04-02T22:20:21Z","snapshot_observed_at":"2026-08-07T16:13:24.968703Z","submitted_at":"2025-04-02T22:20:21Z","title":"Less-to-More Generalization: Unlocking More Controllability by In-Context Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02160","snapshot_observed_at":"2026-08-05T20:44:16.671224Z","title":"Less-to-more generalization: Unlocking more controllability by in-context generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.671224Z"},"links":{"cited_paper":"/paper/2504.02160","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:8d4753bfd7bd97a7805a41970d57ded096c0e9f34432c297b9d8155dd761aca3","observation_id":"6770393b-c88b-4663-8b23-dc95edadc091","resolution":{"observed_at":"2026-08-05T20:44:16.671224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T20:44:16.792997Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.792997Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b12b92681b8b557d104055f8eaf2bfc6707bcb415947528b50beabf6f1ed8d66","observation_id":"eeea55b8-05d8-4c65-b7ac-5545717ab100","resolution":{"observed_at":"2026-08-05T20:44:16.792997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.640103Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"ebe49004-5ec0-4816-9f20-628a30914824","year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.871964Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:f23f684d666b63dc2be3ab67a48e2ed87bf9088dafb6656671c5813f331b5563","observation_id":"22868f17-5beb-4301-b17d-3d16e94d28f9","resolution":{"observed_at":"2026-08-05T20:44:20.728214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T20:44:16.966007Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:16.966007Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:c7634f215326beb91066a746069b69bd9b41eb41f9088b85e6ecbfee7d04f645","observation_id":"d3fbf88e-5d6a-48df-a184-85ccf5454910","resolution":{"observed_at":"2026-08-05T20:44:16.966007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-05T20:44:17.042652Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.042652Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:2b6dc689ab218702b900f1e7207a18f7341abc176dafa45cf8cc0845df5d6671","observation_id":"33200aa2-a6a0-47a6-a36b-2cecc935da35","resolution":{"observed_at":"2026-08-05T20:44:17.042652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-05T20:44:17.158713Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.158713Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:9e4634449463c67210c1c0914ee84dcda26ea7c2a79658ccad98881c4b1c4a22","observation_id":"6a496748-550e-4b94-9a5a-8e115ba8c9a7","resolution":{"observed_at":"2026-08-05T20:44:17.158713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-07T16:10:49.986016Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-05T20:44:17.270406Z","title":"Gpt-imgeval: A comprehensive benchmark for diagnosing gpt4o in image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.270406Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:5903254532ebb3060c1ba6d36f2abd4c83139ca4fc3fcaf1b9aa4dbcd2ca24fb","observation_id":"c0c1295e-055b-4fd9-a112-8a432002e628","resolution":{"observed_at":"2026-08-05T20:44:17.270406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.436813Z","title":"The fabrication of reality and fantasy: Scene generation with llm-assisted prompt interpretation","venue":null,"work_id":"7c264ecb-26e8-48b8-ad89-8215f9bcc53f","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.333380Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:05d721c16568a2820c59b95d33cd120ab88f702278e0cb5c93be1f752c7d5b28","observation_id":"8ab861fb-602b-4843-91ac-80f88e1e7445","resolution":{"observed_at":"2026-08-05T20:44:20.513604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.249150Z","title":"Skydiffusion: Street-to-satellite image synthesis with diffusion models and bev paradigm","venue":null,"work_id":"ba57911b-077d-4772-bfec-01ef37acfb0e","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.442397Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fccf142d26e780aa6902759aa659c03c85aa76d5a9922338d256b85c5042e20d","observation_id":"152a51c7-8452-4b4f-a891-a2d42955a03b","resolution":{"observed_at":"2026-08-05T20:44:20.319888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09732","last_updated":"2025-04-21T02:36:09Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T05:26:36Z","title":"LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09732","snapshot_observed_at":"2026-08-05T20:44:17.585671Z","title":"Loki: A comprehensive synthetic data detection benchmark using large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.585671Z"},"links":{"cited_paper":"/paper/2410.09732","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:fd044dc7c18107752093d159142eb626540f280ecc93d70323230c938d3288fe","observation_id":"48755bd2-c57a-48c5-aec5-8dd61a2ccc70","resolution":{"observed_at":"2026-08-05T20:44:17.585671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:20.037453Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"e98efb42-2861-4f50-a112-c4296add11ac","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.696061Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:6c4ce81aeccdf26ec84339d5cc62f5e2ed3751233b1fe41c2eefe2acda792e51","observation_id":"8b0dddf8-44ef-465b-a070-e08ecac09a8b","resolution":{"observed_at":"2026-08-05T20:44:20.123840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-05T20:44:17.843196Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.843196Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0fed1aa48e6ac3a066da1c23857e773d951d30029719d46fe7fce9c1a1e5d2fd","observation_id":"71c09a01-7924-40c1-98d8-da3eda218ec8","resolution":{"observed_at":"2026-08-05T20:44:17.843196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.786690Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"09cf9ddf-ecf9-4018-8a7b-9de61e5401dd","year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:17.937041Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:3d7b8dba6eb369f718288b090812aeaa65c485e11fb10b33fd87ed8790cdd646","observation_id":"368ac5c2-1d7a-43de-aef5-1e26b2a2556e","resolution":{"observed_at":"2026-08-05T20:44:19.903316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.634755Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169--186","venue":null,"work_id":"1886b87c-cbc0-427c-afe8-67ffaa2081fe","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.003309Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:14cff8477bc28bccec5a9bc1ec6b1c56c84a3f6999b60b50fbeb98c23e0446d2","observation_id":"1fbe3f38-a77e-41fb-a23d-3a9c4e3cf118","resolution":{"observed_at":"2026-08-05T20:44:19.701308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-05T20:44:18.084915Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.084915Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:00b97d2aa2a1a97d8587a4994eda95060a85c012a42feb30a808b152ddf3bdc0","observation_id":"1c842d2f-a386-4325-bfd3-8d7b4aa80f9d","resolution":{"observed_at":"2026-08-05T20:44:18.084915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T20:44:18.171068Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.171068Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:a0cfcdc37c99fecdb4830723fc0286819d27fffb9aac8e8e92a06f84b195a8bc","observation_id":"57992e02-9dd8-4f1c-b753-d67c0251ccf2","resolution":{"observed_at":"2026-08-05T20:44:18.171068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T20:44:18.224864Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.224864Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:b7cf76b33284928bab77fae198522476b815781d8c4230503e49e6f99bd87180","observation_id":"5fe73f18-f381-49f7-b573-9eb9369a696d","resolution":{"observed_at":"2026-08-05T20:44:18.224864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:44:19.474168Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":null,"work_id":"e10272ca-9b9b-4826-9e35-4be296f31242","year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.313183Z"},"links":{"citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0070da6aac547d7728b67c355a561d1b32d681c24b74c8533ee8f64d802686af","observation_id":"6210cb88-0136-4d27-ac1b-3b0f2b9bb64d","resolution":{"observed_at":"2026-08-05T20:44:19.536676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-05T06:04:07.740731Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09618","snapshot_observed_at":"2026-08-05T20:44:18.395972Z","title":"Easyref: Omni-generalized group image reference for diffusion models via multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.395972Z"},"links":{"cited_paper":"/paper/2412.09618","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:637935d6b51096c689cdcbda1b86e13d8b6a0edd74fcccd2b6b2616c58fe16a7","observation_id":"598ab3a7-4c0c-4cc4-a8a6-16ea8eceeea2","resolution":{"observed_at":"2026-08-05T20:44:18.395972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-05T02:05:40.291312Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-05T20:44:18.490290Z","title":"Mova: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:18.490290Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:7d1cb197788cd656c7ecf500e81bbe975343ec376b28f3847c9debfb01566755","observation_id":"0ff93221-48a4-4c12-9888-aff39271040f","resolution":{"observed_at":"2026-08-05T20:44:18.490290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 34 inbound Pith citation observations for arXiv:2508.09987."}