{"as_of":"2026-08-07T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af72a14799ffe38ae63cccc7c7a0d65010f1b6462363b4191cb04d6d1a520985","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:52.941000Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.240235Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:794446d2d9bbe759751c7e9a30c8fa2da132bd92911fc1d7dffdb3727def6256","observation_id":"43cde051-d7e4-4926-8375-5a61830f08ec","resolution":{"observed_at":"2026-05-15T17:18:53.577665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T14:36:41.467429Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2504.17761"},"observation_digest":"sha256:d94b94bb4a417571df55c5b362e08df0d8ddb801c599a531e6a64a6c24429985","observation_id":"05e16346-56ee-4424-8657-735ad92e1cc8","resolution":{"observed_at":"2026-05-11T14:36:41.949615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T15:34:52.941000Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T15:27:34.288941Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.941000Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:c33187b984138181a693722a1c62c1ab162f856fee3ef3232fd593c50bcfc58d","observation_id":"bb2098e1-9e53-41ce-a64b-85e74d3182cd","resolution":{"observed_at":"2026-08-07T15:34:52.941000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T15:02:16.805570Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16707","last_updated":"2025-05-22T14:08:59Z","snapshot_observed_at":"2026-08-07T14:54:27.053217Z","submitted_at":"2025-05-22T14:08:59Z","title":"KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:16.805570Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.16707"},"observation_digest":"sha256:b9a1965157fc502200e6bd5a464b7f08cfb3d96e3bc1d0d67bff1520cc2388c5","observation_id":"2a0928ba-56dc-4f6e-a987-3068b786be3e","resolution":{"observed_at":"2026-08-07T15:02:16.805570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:46:34.827824Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17768","last_updated":"2025-07-20T01:08:18Z","snapshot_observed_at":"2026-08-07T14:39:00.012683Z","submitted_at":"2025-05-23T11:41:26Z","title":"R-Genie: Reasoning-Guided Generative Image Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:34.827824Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.17768"},"observation_digest":"sha256:e02f6383b6ce3752279b8d8030b05c7813467671171aacb4a1b4a63582c67a76","observation_id":"be32fd37-cc73-4585-8623-2b3b7073afb3","resolution":{"observed_at":"2026-08-07T14:46:34.827824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:42:12.548057Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17908","last_updated":"2025-05-23T13:53:03Z","snapshot_observed_at":"2026-08-07T14:35:57.336977Z","submitted_at":"2025-05-23T13:53:03Z","title":"ComfyMind: Toward General-Purpose Generation via Tree-Based Planning and Reactive Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:12.548057Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.17908"},"observation_digest":"sha256:f5df7974bb2bdd5df993a70bd9312ba7647ad75485d246032f92b7bce930376f","observation_id":"c9887bfd-010f-452f-aed6-0082d6982958","resolution":{"observed_at":"2026-08-07T14:42:12.548057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:20:41.061314Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-07T14:13:49.836625Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.061314Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:75547cf0bd22351221b5e424235387ff9ff844cbfdf36eb5cbcb6a6aac95ebb7","observation_id":"1614e1a3-3500-4594-a6e6-ef53ad82de7f","resolution":{"observed_at":"2026-08-07T14:20:41.061314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:17:45.123690Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.20275"},"observation_digest":"sha256:c3b4e55770ded14245cedcac3e7ee962b246d4ca5b15c4bbcff3456170c3d2bc","observation_id":"db554c65-c3ad-45c8-9371-8fe68adb408c","resolution":{"observed_at":"2026-05-12T18:17:45.508850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T12:18:32.501235Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:32.501235Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:cdbbe0218845626499ca7c46b569615c372f05cd031e060748409f2a7d1a1db0","observation_id":"f9e05ca0-be08-4147-969c-b18a3d36e5a5","resolution":{"observed_at":"2026-08-07T12:18:32.501235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T06:07:24.165875Z","title":"GoT : Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-07T10:25:28.420174Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.165875Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:69891c19e242aa5030bcd759e62548b9eaab47e8811df6c974d0c3f510c9988a","observation_id":"e85fb9d6-0103-4439-b9cc-e33646806b97","resolution":{"observed_at":"2026-08-07T06:07:24.165875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T00:40:19.605957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-07T15:29:39.049060Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.605957Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.12830"},"observation_digest":"sha256:0dae7010c068217dec09ae096dc1c7c684baabaf0887ceb2ddcff5a4ee7fdba7","observation_id":"74ba5345-9cb4-4895-ac99-6692f515617b","resolution":{"observed_at":"2026-08-07T00:40:19.605957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-06T05:40:56.881671Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01394","last_updated":"2025-08-02T14:58:34Z","snapshot_observed_at":"2026-08-06T16:12:20.880690Z","submitted_at":"2025-08-02T14:58:34Z","title":"Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:40:56.881671Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2508.01394"},"observation_digest":"sha256:545c2603934e822c5e00b0218b63d2de82d774729cbe101fd793898a9dc53863","observation_id":"0feb2e14-1f15-4d9d-b0ec-05c9ae66f644","resolution":{"observed_at":"2026-08-06T05:40:56.881671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:fb132d65f8b7e126303292197beb854bd65da08b4d6ddadebe910ce7237853cd","observation_id":"5be1d564-b5ec-4ea8-b747-5d355dacab17","resolution":{"observed_at":"2026-05-18T19:21:48.132193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-05T10:24:55.232863Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04126","last_updated":"2025-09-14T00:18:40Z","snapshot_observed_at":"2026-08-05T10:24:49.011461Z","submitted_at":"2025-09-04T11:44:28Z","title":"MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T10:24:55.232863Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.04126"},"observation_digest":"sha256:954edad28f1a721a96361934e54b790a6c957bc4114ce2eb3423d1d7c03a06d1","observation_id":"86739b7b-e6d6-4ebd-a99e-dd28b5e1bf17","resolution":{"observed_at":"2026-08-05T10:24:55.232863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T22:55:44.877594Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-04T22:55:44.250639Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.877594Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:4301c58d85be8bb33b0c1b3447d2cd09148d0d32783f1905fffb971590e00d86","observation_id":"9f56752a-f678-4670-b871-473500b61ff1","resolution":{"observed_at":"2026-08-04T22:55:44.877594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T22:36:07.936009Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:07.936009Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:130088a7ec9ff76a77ffd785232ee9837a5da6f5f75a4abf55baa3987ef582e5","observation_id":"1ad52245-d29a-460c-bd5d-77ca3b5b34fb","resolution":{"observed_at":"2026-08-04T22:36:07.936009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T18:48:03.645811Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.645811Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:5958c2a343704c373b616b4d6128f65d394fc431b44e065dd8d8ef6efcf50840","observation_id":"15feb0bb-9423-4260-a030-ccd50ba0b956","resolution":{"observed_at":"2026-08-04T18:48:03.645811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T09:54:24.239016Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.239016Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:228e6685170b03fb8a8c58a3427e4eef853f07d9dd0ad1d32b9ed193e57f12d9","observation_id":"c317703b-34b2-4365-81ba-33f4da95b3ef","resolution":{"observed_at":"2026-08-04T09:54:24.239016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T17:06:54.722954Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-06T22:04:38.705956Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.722954Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:f122530b202a78a557cd15cfa6a63b87bfa925c8ff5e38803f82f0389b98c1db","observation_id":"b5450353-038d-4dac-a264-4d7fa7247780","resolution":{"observed_at":"2026-08-03T17:06:54.722954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2512.13609","last_updated":"2026-05-14T17:13:30Z","snapshot_observed_at":"2026-08-02T18:51:26.411748Z","submitted_at":"2025-12-15T18:03:42Z","title":"Do-Undo Bench: Reversibility for Action Understanding in Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T22:10:29.304091Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2512.13609"},"observation_digest":"sha256:99780d838a941c05167246d581dcca1e54dac45ededef83c32796a3aeb4d21e7","observation_id":"f8b3094d-71f9-4f13-968f-a51d8674b083","resolution":{"observed_at":"2026-05-16T22:11:18.473960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:81ab3366a5fe418d2500899a3f3aa4bcf336712d68d841477dbc0301894732c6","observation_id":"b4f0b072-f1dc-495e-9848-97a5fb37d484","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T02:33:53.930732Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-05T23:10:24.488750Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.930732Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:7e8ab0382cf1e54c02cbe87ece62ed3d409e831bb9818fc54aeebb105159b1b3","observation_id":"3766ccda-d2e8-4b89-a5ea-a612eab982a5","resolution":{"observed_at":"2026-08-03T02:33:53.930732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.10454","last_updated":"2026-04-12T04:32:30Z","snapshot_observed_at":"2026-08-06T09:27:45.077300Z","submitted_at":"2026-04-12T04:32:30Z","title":"AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:49.575589Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.10454"},"observation_digest":"sha256:920504db12ce7f68b0c127ea87b59d42c05d3f09d0dc4a4beb0da10567f8336f","observation_id":"14adf7f1-dbb3-474f-be97-4dc5bf312958","resolution":{"observed_at":"2026-05-11T10:11:04.280660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.23763","last_updated":"2026-04-30T04:05:16Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T15:28:02Z","title":"Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T06:47:22.451132Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.23763"},"observation_digest":"sha256:9c1ad9c5befb4bdfa2d34afdc9b7a323dc969b4284699f322b556d7c99fbe896","observation_id":"62b9b7dc-027b-415e-9552-c6643be237f4","resolution":{"observed_at":"2026-05-11T21:06:13.722077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:e58eaff6a7e0eb75c032546940f36c8a994b298b9face719462d3ea80f4659ac","observation_id":"c251ec09-3171-4a66-8787-bfef63b28c40","resolution":{"observed_at":"2026-05-11T21:41:19.274947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-07-30T14:06:30.177866Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:8b8c7aaea8eb5f22493fd3b0233b640f334f9d6505c40a341573efae194a9cac","observation_id":"2cbfaf2e-1b78-4469-9421-422f690c10d1","resolution":{"observed_at":"2026-05-11T04:31:00.029682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.10859","last_updated":"2026-05-11T17:05:52Z","snapshot_observed_at":"2026-08-02T17:39:12.809856Z","submitted_at":"2026-05-11T17:05:52Z","title":"Masked Generative Transformer Is What You Need for Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:52.355925Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.10859"},"observation_digest":"sha256:0a99fb918a91fa3e7189f41c008507520f30858e60771adbcf38238c9078284a","observation_id":"af9e71d7-eece-42b0-b3e3-f446fe819732","resolution":{"observed_at":"2026-05-12T06:06:26.027511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:86869a37da31e30719b2747f2a3bf8d99504e8a29556be498647d25a5a121d98","observation_id":"2eb83584-ced1-4f53-b90d-a9e56d3d8c6c","resolution":{"observed_at":"2026-05-13T01:47:04.960167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.14842","last_updated":"2026-05-14T13:46:24Z","snapshot_observed_at":"2026-08-06T21:38:07.402815Z","submitted_at":"2026-05-14T13:46:24Z","title":"Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:41:10.852265Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.14842"},"observation_digest":"sha256:c8f42d7c16b504fac80cd9b8132608d94ae9aee2194e530a015b876387b2856e","observation_id":"65c4a275-426e-46cd-b7ad-8b45e09534c1","resolution":{"observed_at":"2026-07-01T14:25:46.043811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.19852","last_updated":"2026-06-03T11:11:28Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:44:26Z","title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T06:16:47.650748Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.19852"},"observation_digest":"sha256:e735aa2953a63dd0a25949bb110e9bf86d07c93386a50640490037963d0fccfa","observation_id":"a57079f0-abd8-431f-ac79-e66a5a1ac02e","resolution":{"observed_at":"2026-05-20T06:18:05.182007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2606.04479","last_updated":"2026-06-03T05:53:58Z","snapshot_observed_at":"2026-08-03T21:43:54.545392Z","submitted_at":"2026-06-03T05:53:58Z","title":"Evaluating Reasoning Fidelity in Visual Text Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T07:03:38.967856Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2606.04479"},"observation_digest":"sha256:7ea422b3d9279426560cf776d10f68c1fdff0d067da95cb696f5815be967ae7e","observation_id":"14463bd6-eece-4c48-8105-59f7a7b1fb00","resolution":{"observed_at":"2026-07-02T07:16:44.516479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:85d3d5eabe7ed5cbe4a8d301d6a25b681c4814bed8556114e1e39f4d8ee2d4d2","observation_id":"814bee08-d142-41f8-bbd4-71e59b4c17f1","resolution":{"observed_at":"2026-07-02T08:26:47.752091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:2b53af5c1fafa7864d12f76bb5df02f967c5f30920714e7314f8822bdc07e37a","observation_id":"364406dd-a65b-4b65-8622-0a880d401306","resolution":{"observed_at":"2026-07-02T13:56:58.969221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-03T22:17:48.449247Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:33f7c48f372862fc804697b0988f21b1ee6de818a543ba9dda81ecee60c7195d","observation_id":"e6a8179a-8d93-479a-90dc-1b99efc7a669","resolution":{"observed_at":"2026-07-03T21:28:58.241767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-03T02:26:02.235143Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:589fe61a60bef4e9c3f11df4b3825aefdc5cb41826a9ec270dd53586c0e2c989","observation_id":"cec7d7d6-c797-4468-a227-9ac89c904e7a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.10639/citation-record","integrity":"/paper/2503.10639/integrity","json":"/paper/2503.10639/citation-record.json","paper":"/paper/2503.10639"},"outbound":[],"paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:06:06.948584Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2503.10639."}