{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b4ac928603d54c0860b1c5b3eaa28ccd220164121c739a5f9a8b6d45f52588c","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T15:24:53.016199Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05465/citation-record","integrity":"/paper/2607.05465/integrity","json":"/paper/2607.05465/citation-record.json","paper":"/paper/2607.05465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:bcf58eb701d03d211cebf5af7f25c3d1aa09cda29fac39f71d391437df2596a9","observation_id":"7af8c52b-38d5-4a4a-acc9-7c29ef24f3b4","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Sensenova-MARS: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:1a7ee5f78bb6fb3c2d2f74041a1cc80eb1c7f012f9ac5424db03741023d9de31","observation_id":"77a523ac-a857-4ac9-9c33-9cdce6c319b0","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"ToolScope: An agentic framework for vision-guided and long-horizon tool use.arXiv preprint arXiv:2510.27363, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:db8f039d915da93000b12fe8753602b06b8c5adefce956b8b0f09896423d05ab","observation_id":"5ea1d2f4-98a9-432f-972a-8401f539e241","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Guid- ing instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5f87e50bf28d61840ee41955ec8ebeb49e86ac71247c6d62c2e0bfaf1f338c8b","observation_id":"0b80a2fd-87a1-41fa-bf1d-0582d4bfffca","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Beyond seeing: Evaluating multimodal LLMs on tool-enabled image perception, transformation, and reasoning.arXiv preprint arXiv:2510.12712, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:0190381e4ee8bd21a191ca2e595b8014e153097547ce1d890d11060cb740c2dc","observation_id":"a2848ef5-fa2e-4880-9d1a-7fdb60429e3b","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11559","last_updated":"2022-11-18T18:50:09Z","snapshot_observed_at":"2026-08-05T09:04:05.570299Z","submitted_at":"2022-11-18T18:50:09Z","title":"Visual Programming: Compositional visual reasoning without training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11559","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Visual programming: Compositional visual reasoning without training.arXiv preprint arXiv:2211.11559, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2211.11559","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:e7563794346099dd82b4e6e7bf36efaafae41bf7eaa0aa9dc7981d89b23446a8","observation_id":"0359ec15-96f7-433d-a80b-280fa4e0a837","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Deepeyesv2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:7c909003dad655e63f57d465aae8e59eb1f3f896e53d5ebccc19470a99f0a386","observation_id":"e69bc790-2ef4-4bd5-9fe9-9d9d8116b4c1","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Search-r1: Training LLMs to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:b8132b9ea2ece73d140b48d454d2d1408966df2537789ee65c5e1e2d09ec2a59","observation_id":"a9edf56b-950f-45f0-b1e8-ffc8fecb8292","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17612","last_updated":"2025-06-21T06:36:00Z","snapshot_observed_at":"2026-08-06T23:28:12.134022Z","submitted_at":"2025-06-21T06:36:00Z","title":"JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17612","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Jarvisart: Liberating human artistic creativity via an intelligent photo retouching agent.arXiv preprint arXiv:2506.17612, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2506.17612","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:995c1daefdb3bf62f525eba3b6c217b394ef95db46dbd4ebd5fac8d58393024a","observation_id":"593f5918-d195-4542-a74a-7fe02bb5a70a","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Jarvisevo: Towards a self-evolving photo editing agent with synergistic editor-evaluator optimization.arXiv preprint arXiv:2511.23002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:d940b0a1c1ae620b5d545f42e224c43af3d62e141e471122e7350754ee43cdb0","observation_id":"75f82ed2-b139-449b-a947-9d3dae113d51","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:7a02cfb1eacf9bffa677eb7955a0070d6504f5b0177a5dd6f7d9a9388676f099","observation_id":"adb5b392-b430-4337-ab6a-a6d8c94c1f11","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Pico-banana-400k: A large-scale dataset for text-guided image editing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:a2f621bd140b524d549106cc6703b631b8fcae034fb44d8a0d395263d2bee0eb","observation_id":"0bb0967b-3959-48da-b05f-d884dbc8030f","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:b2bea67610ae39839cc0b2c71a8c9bb8e1ea41f75b40bffe1a445b76ac24eee3","observation_id":"05e83d41-7ea8-4f13-bedf-0952e51627ef","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Fleet, and Mohammad Norouzi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:c75ccee8aec7fd4095fe1596b9f3cc1efb5c178976e2a3916b5bb1928d930f0a","observation_id":"f7beb81d-456f-4cde-99c4-a5a6ca8783d3","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:97fb9ce1fb681f7b23477bd31381cef7a7327167bdfe22e3c2f9f5382953cc96","observation_id":"bbfdf901-09a1-4bf3-b49b-102eee7215fc","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:e6ab0d9c92bcd073469cd77a3db2aab36736d9b48061c78d180ff8a345ac4a20","observation_id":"24ebaf06-0380-4f2e-b2b1-c405ca6b8320","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"ZoomEye: Enhancing multimodal LLMs with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:ca3d9dba7a8b71558f91279ac0df04604632a8b21196a3d4b0a503744cb619f4","observation_id":"3197a0f2-71d7-473e-9133-04261f759ec2","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"HuggingGPT: Solving AI tasks with ChatGPT and its friends in Hugging Face.arXiv preprint arXiv:2303.17580, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:8370d0a8ba35e314133cdde35843261e66ae00204f8145c661ae825a24eccd4e","observation_id":"073c118f-7b32-42ba-baba-50c4ca921747","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10089","last_updated":"2023-11-16T18:55:58Z","snapshot_observed_at":"2026-08-07T16:25:59.525118Z","submitted_at":"2023-11-16T18:55:58Z","title":"Emu Edit: Precise Image Editing via Recognition and Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10089","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Emu Edit: Precise image editing via recognition and generation tasks.arXiv preprint arXiv:2311.10089, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2311.10089","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:082090c749d794497e7b528a1a63a58ab8c4bcd2d6325d582a6e1e239562c124","observation_id":"98267f55-a184-4821-96d8-722237dc1155","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Codedance: A dynamic tool-integrated MLLM for executable visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5df7d617c834c556f3413006d086194502f21920546bb2c6226b7429efdc275d","observation_id":"920922f2-6c72-48c4-afd8-5e17bcf4bdd7","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"OpenThinkIMG: Learning to think with images via visual tool reinforcement learning.arXiv preprint arXiv:2505.08617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:b704deeaacd57383ef405e52da49359a59c436c23bac82016f79928af8e96bff","observation_id":"13a87fb1-937f-47ee-ae92-86e720b211e1","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08128","last_updated":"2023-03-14T17:57:47Z","snapshot_observed_at":"2026-08-02T12:31:34.577778Z","submitted_at":"2023-03-14T17:57:47Z","title":"ViperGPT: Visual Inference via Python Execution for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08128","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"ViperGPT: Visual inference via python execution for reasoning.arXiv preprint arXiv:2303.08128, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2303.08128","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:d23a2b432b8156cebaa4a8b54fa3ac7ffc5495cba854b54ba080d45fb65d52ee","observation_id":"475d80b8-ec20-4910-aea7-8c0f3ca4bc1e","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-08T15:29:25.221437Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Adatooler-v: Adaptive tool-use for images and videos.arXiv preprint arXiv:2512.16918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:71823a4fd0cd6d11e1ae4e1017e2a69b3e2d0b87eb0845536b11ba6e306171b2","observation_id":"483223c2-d70c-46c9-a9da-0dd4d9d7f714","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:75e1cee23ddedf05cdd653b30d0691c690054113fca0ea94e3100b4a4c7d9d73","observation_id":"9b9edc69-2b52-40a9-b50f-90c37ec7888d","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Qwen-Image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5b01786604c69d407f17623be2948bc2dd6cbaf5c2a4f539c757ead41a311e9d","observation_id":"bd99e533-0839-4a77-9aae-817b237a98de","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Visual ChatGPT: Talking, drawing and editing with visual foundation models.arXiv preprint arXiv:2303.04671, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:fc20628dfc9652a36749060f02ea9cb01497b158f3b7df2c9ad4c5f311c68bb5","observation_id":"0058b84e-3db6-4097-8ba6-ec4ad83f4553","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"MMSearch-R1: Incentivizing LMMs to search.arXiv preprint arXiv:2506.20670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:f2455f2417db3b96ea0a8209b2612971a57fe4f643969562fd5d80cec5492218","observation_id":"db4963ce-c8f2-413d-a49f-f38173e4dbf4","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08545","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Act wisely: Cultivating meta-cognitive tool use in agentic multimodal models.arXiv preprint arXiv:2604.08545, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2604.08545","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:8e4895581125cc54042c8596de42d271e2a119e1a83a6ab96cf794bd47d46832","observation_id":"2f5fc1fc-fe86-440c-9020-925cf50e605d","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"MM-REACT: Prompting ChatGPT for multimodal reasoning and action.arXiv preprint arXiv:2303.11381, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:507350d42fd62b20dd6d7fb106d41196ac9693cf8ffacccf60e84d55c605e40d","observation_id":"866d5f14-c40e-4e54-a508-b93d2adcfd23","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5f0dda1a6571ab859a7f4365f02ac9a2382c7daf27336925433b5c7d9165489f","observation_id":"b2ad1a3a-313e-4f43-a3a3-aa01379c0ac8","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"MagicBrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:b9068b4597ebdd5bd04146e38883e99ba1aa25c382256f56bf067aae5c2d2fdc","observation_id":"95fe9acc-68f7-4cd5-bc0f-d97ced38e83d","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Tool-R1: Sample-efficient reinforcement learning for agentic tool use.arXiv preprint arXiv:2509.12867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:c272d8e8ddd9d9ae5de73d8189e016ada1bd83aa3dbae6eef3e70eb73704d8e7","observation_id":"fb24a7f7-f626-4361-bf99-a8ccc27eded0","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Thyme: Think beyond images.arXiv preprint arXiv:2508.11630, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:6739e2d37c16d6c6bf649e1e37bce4c61ac2e6289763ed32678464742b955aa8","observation_id":"9412f523-83c7-4034-ba53-801ffdf9dd13","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Skywork-R1V4: Toward agentic multimodal intelligence through interleaved thinking with images and deepresearch.arXiv preprint arXiv:2512.02395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:6401aa2bdc7110d1373f073f4f53871133c4c42333ce2ea53141c7041f8d5292","observation_id":"5c3b21be-b2fa-4add-af4d-4b42ff7626f4","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07998","last_updated":"2025-08-27T07:42:56Z","snapshot_observed_at":"2026-08-07T15:21:56.692035Z","submitted_at":"2025-07-10T17:59:55Z","title":"PyVision: Agentic Vision with Dynamic Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07998","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Pyvision: Agentic vision with dynamic tooling.arXiv preprint arXiv:2507.07998, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2507.07998","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:f70f6a395413973d1e659bc8b1628ca81eeb22f4e9d5afb07accf6c6a0cc29fd","observation_id":"90cd6298-e4a7-4061-9495-76b0817be375","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:8eb7e314f046e99166951622e4db502bd304be98956b05293b10ddcaa59a6927","observation_id":"455e962a-f598-4f3f-bd25-de20a1756747","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:353aa218c9b9707e1828b86c799c7fc95ba23d78a2ab0af8c6b65a345b8db0f7","observation_id":"7012fe28-4b2d-4ecb-a0a0-3e16095da419","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5fe2abe1f7aa33f37e0b96b2001563dd5300ca41b852d5a2f2fbef2ded400e68","observation_id":"ad232445-1fa0-45bc-9e76-0408d524d824","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"Focus on semantic correctness, requested objects/actions, positions, colors, text, preservation of the input image when editing, and overall visual fidelity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:b5aee8d4e8b8682ae2d602be114a586b1e6cd32d1fa028ebf80a20cf1ab585e4","observation_id":"d2a708d7-c68a-48fe-9185-8a2fcf6b707f","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:7d40b14ee4643139b7074350069a95101ebaae7110a570e6f379d94d6a291f14","observation_id":"9af624ed-6575-441a-afc3-c088c7290837","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:5b33585e3838c5104630d20811face9bdd0ba83d924d48cf53963c372234224a","observation_id":"9758187b-7eea-4c46-83a8-a2cf9d1f6bc5","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:24:53.016199Z","title":"score\": 0.0} 17 Table 7: Distribution of tool-chain types in CanvasCraft-SFT. The “Multi-tool Hard","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T15:24:53.016199Z"},"links":{"citing_paper":"/paper/2607.05465"},"observation_digest":"sha256:462618d6b190a5fefe3a4785e54a6764644a832db6059b0b3a0a6e05465ca135","observation_id":"50be376e-7ecb-4a8e-95bc-7bce008c0938","resolution":{"observed_at":"2026-07-11T15:24:53.016199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05465","last_updated":"2026-07-06T04:57:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:20:15.118625Z","submitted_at":"2026-07-06T04:57:18Z","title":"CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2607.05465."}