{"as_of":"2026-08-08T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:996f9de45cfbb14b0e08855a05768a46864bbd92799bead6f937723ee6f6c01b","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:18:49.849794Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08016/citation-record","integrity":"/paper/2606.08016/integrity","json":"/paper/2606.08016/citation-record.json","paper":"/paper/2606.08016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:43ea3fee53b7a4a3654339abff80a07d5c395b8a1d62f576347efe94a9905464","observation_id":"22783057-56b5-4371-a524-5660c948e57e","resolution":{"observed_at":"2026-07-02T20:37:22.767912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:6089ba53313439f878215b888fdfa457345b2a0eca42f02a69f8466ed8a76f1d","observation_id":"1cbd9461-4551-4436-a93b-1bb8faa5d85d","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:cc733a676c3ce1a22dbe36e32fb46d57c33d494708b501ff68dac5dbb19c6af5","observation_id":"828af531-1d8a-4ba3-ae94-7a01499d656d","resolution":{"observed_at":"2026-07-02T20:37:22.749105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b1fe22d0a99684400d04d501b99e76991d6fd5e24fa62ec2ca5286b5310a6c9f","observation_id":"085e34b3-0f8f-4e37-927b-a3cde53562c2","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Learning photographic global tonal adjustment with a database of input / output image pairs","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:be138d79d7d98358ef158cbe4d9dc11b63e841bb6ccc677b7c820c8de7b07118","observation_id":"91b22ef4-5c0c-432d-8fd1-430c3bcfbe64","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23130","last_updated":"2025-05-29T06:00:51Z","snapshot_observed_at":"2026-08-07T12:50:29.281980Z","submitted_at":"2025-05-29T06:00:51Z","title":"PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents","version":1},"cited_work":{"arxiv_id":"2505.23130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23130","snapshot_observed_at":"2026-07-02T20:37:22.750225Z","title":"arXiv preprint arXiv:2505.23130(2025)","venue":null,"work_id":"51bbff10-0268-4c9a-8fd0-5b676a1d4c45","year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2505.23130","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:7c291462bcdb0cb02ca13f1439b0dfedc984978254b0955eb35d0824d388133b","observation_id":"d0d838f0-03ec-4a95-9afc-cd829d7674f4","resolution":{"observed_at":"2026-07-02T20:37:22.751704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:717616d57870a6fc88467314f93359f48d670774c0e1361744f13d1c13785623","observation_id":"1a145489-045c-4a1b-8e0b-366b3a4d3595","resolution":{"observed_at":"2026-07-02T20:37:22.743815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Conde, Zihao Lu, and Radu Timofte","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:8c0ccf8a77f52a5183c7705c59750bfdbc9c891194f19383c86c5db351771e84","observation_id":"949c4d8e-8bc2-479c-a9bc-6651e38f20a7","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Turboedit: Text-based image editing using few-step diffusion models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:3e8a190373ae89665b64435429dd7319566074c4822fc92f30b268268d890ab5","observation_id":"ca6c5c37-c205-435a-bff8-c756038841db","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"A survey on rag meeting llms: Towards retrieval-augmented large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:6d1c51f014668f58d4d2da085ee6f6ae5c244c74b0485f406eb827c4f7c72c63","observation_id":"2f4c288d-89b7-4292-ab45-3910de06bfcb","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Guiding instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:97c23ca7db339aa0ef5b61e3973777558d667db3d954e39c13359da608891733","observation_id":"2b202c99-5069-44da-b508-fc92914a00be","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Efficient tool use with chain-of-abstraction reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:65193294d7cef6bdcd916cf6d35fd37167baf77fcdb4ee756f0b0faabc8c5387","observation_id":"316443c1-9d61-4415-91f2-fd2f2e294a59","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"ToolkenGPT: Augmenting frozen language models with massive tools via tool embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:0e03b34f936c57d2dd569ff89812a0e8f898db567ba22a4e3e922f4bae63ecf7","observation_id":"ce814a5e-38f2-4180-ad32-50b499d90842","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:1e43c7e2dec93934856b53c0ff58ab18bb1762c1f9f0f16f57a2adeadf84b968","observation_id":"82f362c9-9a8e-4029-b121-c05f8ba196d1","resolution":{"observed_at":"2026-07-02T20:37:22.770320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Exposure: A white-box photo post-processing framework.ACM Transactions on Graphics (TOG), 37(2): 1–17, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b281cf41b68e686fed3bc10c5c565ba5ba20327f829cb1085d5246b240ea3bb6","observation_id":"44954527-50b0-4652-8c27-7d676d146a4e","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"PatchDPO: Patch-level dpo for finetuning-free personalized image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:e9471b7d01f27d2d2607029e2b7d42dd3bfe9d7ad02285fdb2e65cf7d54a5eea","observation_id":"c9490f7b-ea5d-4e7d-997d-38155e113495","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:96e68c6a1efa55cc37728d32113b798f80a6743fe2474e448a32a8fae8a306d0","observation_id":"95103d4a-faa6-40e0-a5bf-044a4dd065bf","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Survey of hallucination in natural language generation.ACM Comput","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:10cc4fe410ac9a983628b5c1fef4773ffdb153eb8b9fa5a0b2add3fe5398aff7","observation_id":"d095e9f0-9b45-49ab-8b18-f420e6c5a514","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:dcc95e739327a9b5148ec871182e411110174f0014427a2dcf2ae45773d4fb63","observation_id":"cd05d687-356f-4c24-baba-727f3ff3b23b","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:71d0531137ccfe2400b06f88bab1ee20e8933cbde7cf6315ecc7f97b5a05a3da","observation_id":"7dd4e413-271a-4ae4-b177-301d85954c36","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:aa5f088098393f6a3c1309bf00c5bedd71c7295c7a3c396a584ce69d42dae497","observation_id":"805480fa-b98e-444d-8780-2ca17a026400","resolution":{"observed_at":"2026-07-02T20:37:22.760595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:72045c62b3ee69bfc8118fbd30e01617d216c4cd3268a73b0399d7ac364e2610","observation_id":"13ce8fc4-281b-4c02-b6f9-a72d961cae54","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Zhu, and Mengyue Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:e6d3d716a83b6e0ea1561691df501090d7d1b28af36dc62d8a5524b83ff2ce08","observation_id":"63cb8613-5690-4bb5-84e6-db036efccd6b","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Cliptone: Unsupervised learning for text-based image tone adjustment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:aadc901be99acb24a5f1ef6d7205512963323a3a954904102c1efbd006614928","observation_id":"6888f7b7-ab67-4df1-8ce3-0ad111c1bf3d","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Unsupervised dense retrieval with relevance-aware contrastive pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:18c2a4464e2113e3a1551f7e93a78022f17978d5a7805be1dd2c346df7584381","observation_id":"6f2f2ad8-e97d-45f1-af89-1ce3f4ec53af","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Api-bank: A comprehensive benchmark for tool-augmented llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:39cd7b114d41fed9c453e0bd7a1dbaef97be01b94e35d31d8df910cc7dfc58e8","observation_id":"12e460f7-960c-4d3b-9f5f-12f4e1dcc5f1","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:ad416abfa65fe951841ae75dcd3ee971b2f0a0b41302803249627ab5f8285c73","observation_id":"3c6f7c62-8035-4b69-bb03-08fb6b03b045","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17612","last_updated":"2025-06-21T06:36:00Z","snapshot_observed_at":"2026-08-06T23:28:12.134022Z","submitted_at":"2025-06-21T06:36:00Z","title":"JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent","version":1},"cited_work":{"arxiv_id":"2506.17612","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17612","snapshot_observed_at":"2026-07-02T20:37:22.746354Z","title":"Jarvisart: Liberating hu- man artistic creativity via an intelligent photo retouching agent.arXiv preprint arXiv:2506.17612","venue":null,"work_id":"8bb225e0-e849-4dd7-87ce-05ceaf11b4aa","year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2506.17612","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:f47cee5d4dff2dcdf75f11a1c23e94bfcf26246f3710c59e6423f99173093788","observation_id":"c8c96950-e9b2-46a8-9ce7-466c69c2afad","resolution":{"observed_at":"2026-07-02T20:37:22.748004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00839","last_updated":"2024-02-29T02:04:00Z","snapshot_observed_at":"2026-08-07T18:46:41.789440Z","submitted_at":"2024-02-29T02:04:00Z","title":"ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph","version":1},"cited_work":{"arxiv_id":"2403.00839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00839","snapshot_observed_at":"2026-07-03T13:28:19.032648Z","title":"Toolnet: Connecting large language models with massive tools via tool graph","venue":null,"work_id":"6472076e-87bf-41de-92b3-6340f9e231b6","year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2403.00839","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:4f6be5eb75032ce494ecd6b009be4fdc2e436e9e99839867747eec97638d10e4","observation_id":"d1c99573-59ed-4734-b556-524ee20a4492","resolution":{"observed_at":"2026-07-02T20:37:22.767026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Agentbench: Evaluating LLMs as agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:8396e4a7e3e0d79e5c087fe91e0a1d459289ddb86d0949ceb707cbb28bd393fd","observation_id":"ee5b1006-0fa9-4be7-b821-38d74fdba0e4","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Controlllm: Augment language models with tools by searching on graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b7492be497da285691d16bd00cfd088c219f3e69b4d893d57cee3a13aa9c688e","observation_id":"223e417a-7b67-4852-9c0c-1804c415c6b5","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Apigen: automated pipeline for generating verifiable and diverse function-calling datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:a52b3111e4f5ce26d20d64a52b00fd9d3934cd1e00126c86287ff1254270b991","observation_id":"05cfb4dc-f2ea-49f6-adcf-d82b0ea57728","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:6f2c8fe2c9338f38ef0e54660edb238a5d482600b25956a2813876e4d17c0311","observation_id":"2e7542f9-e170-47a1-b4f9-5e56ed9054a1","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:c21847446e1fa6be08de6a9e1c86e5890336a6cb6f8b69da98d375163f60d73d","observation_id":"f8242116-bee0-43e3-a852-11a167beb8a0","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"TOOLVERIFIER: Generalization to new tools via self-verification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:a84dd33fb10683ff9aa0c0d478940f9501b1a12c84c01cf6f7ebf7fc20e4d294","observation_id":"bed65fea-865b-4b68-bc82-90b3788ddb60","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-08T06:35:17.078531Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2108.01073","doi":"10.48550/arxiv.2108.01073","metadata_source":"pith","pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","venue":"cs.CV","work_id":"cfaeaf1f-2560-4505-bcdb-c9aa6cc99d83","year":2021},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:cfde0194c08d6566a54dd497b68d8443d8da22a388f9592dad00983e593f8a21","observation_id":"9783f90e-49af-4fd6-b59e-8cf3ebb9f1ab","resolution":{"observed_at":"2026-07-02T20:37:22.742180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:01.687066+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:01.687066+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b2de0796904649c624dff5d1d20f99fc4a10821a0ad1b85bb041cabe750cefcf","observation_id":"b3146e09-f725-4e9e-b8d1-486d5cab5560","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:c970d6e5abed524d19ae374b90db4cf4b865d80646bc885a61aae7863c16df33","observation_id":"9a5d0740-45f7-4cc5-bf9e-35fdc99c1e50","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Introducing our latest image generation model in the api.https://openai.com/index/image- generation-api/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:1a21e87203d0dbd2d9ac3821212b1b985e6e2ddf819cba44bbb4759b0a550235","observation_id":"a0404403-c102-4829-bc7c-5f61fcfd7f01","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Introducing gpt-4.1 in the api.https : / / openai.com/index/gpt-4-1/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:3afd1ac827f16d60015804cbbef9d486e8db88d08e39b75156b73692740cf23c","observation_id":"0e526749-e79b-4ee1-8aea-45cbb64665d9","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:41ed86eb579d0f279c1208bc26dff549f1f61c71a748e00c329c15f57f88697c","observation_id":"31d7b864-65cc-46ff-8967-1d20ef6231c3","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Distort-and-recover: Color enhancement using deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:3c019ac70d44cb4a1f0c6bdc95bf40c880b4bafe41ac1231e87765483ece048f","observation_id":"cdb2672c-88ca-45e7-9a93-ffa2e8e73e0d","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Gonzalez","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:c663bfad8118f8bba75250c87c50f7398ae4dc529b06177319d46fb99e9d63d2","observation_id":"3251990f-584b-48f9-90d4-e8af3f321dc4","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Toolink: Linking toolkit creation and using through chain-of-solving on open-source model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:23e265572fa7a5b96d6835a0bfaeadd773f4bbca14de1980cf0d855c464e485b","observation_id":"d0132dc0-6d35-4a3a-ad1b-4dbb8ac57de1","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"ToolLLM: Facilitating large language models to master 16000+ real-world APIs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:a99fab7d59befe503898ad57d319315f18291f1b103dd2244a1426cf51174535","observation_id":"5f17d73a-a355-4382-bda4-47af78fc8f51","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Towards completeness-oriented tool retrieval for large language models","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:241132b404cb66d25c236437be553d5966777ee44e6f1b8a43f854e59bc66bec","observation_id":"2be7002a-1a24-43c9-a0a5-b4ca409dd0ff","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"From exploration to mastery: Enabling LLMs to master tools via self-driven interactions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:85b325fdb945636c1a0e56136eae7f87eed53dd9bd503828c5816c8c22b3dd97","observation_id":"21beff9c-1d60-4c6a-a8d9-2542a54125e8","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b3e0d6b479eecb6ff738e461ed49426b8fb4c9167c624b98101030427e254b29","observation_id":"9093b66f-d6ba-477c-a8cd-7313dcac9449","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:996e145458498e6678fe99a60b60d754ff2012ece085ba68df95b1bad4d98fdf","observation_id":"5142842b-68f1-403e-b4d1-88b50ea7d700","resolution":{"observed_at":"2026-07-02T20:37:22.763012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:3f4d87c1f8817d330e9725946a04338d5d89d85c975831ebcff6a30ed3b30ffd","observation_id":"3998f59f-e314-4e95-8e11-c8c5750169fa","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:9e61381427c020652c29598f8a2863d70679c12439b47566392b28b6d6cb61cf","observation_id":"825998d3-adbf-4f4a-bfcf-738e8c898f89","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:9c16413bcd8f71fe3f2dd4446c12e51c829c61cf8d142ca8a9ec62c6595b9dec","observation_id":"c80b4372-011e-4bb3-86a1-cbfff6e07c2d","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:98413313d83f66973acb6efc91d7c6923a6ab38848b1a9cd5414b96b33997c58","observation_id":"8501c56a-7b97-4cc4-8e91-b79c7724c80c","resolution":{"observed_at":"2026-07-02T20:37:22.759479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Hugginggpt: solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:55eb8537c1d65742b178c7f27a2deb70f6e4c0f09c088ce89b8bb3811cfca277","observation_id":"e3c226e6-cfbe-41f1-a890-01603fb0af72","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:6393a6473f09f93cd943c100f183efa4f402f15a16ce8d3520741323885137a2","observation_id":"3dba284e-7321-499c-a584-f16fea177680","resolution":{"observed_at":"2026-07-02T20:37:22.765503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"A benchmark and baseline for language-driven image editing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:422a6ab932fc34893ec7f4daab21c0700d0529fe6b1810eea7fcbabab47e83fa","observation_id":"3c07f04a-9525-4e79-a8ba-f1d9de36b71e","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Learning by planning: Language-guided global image editing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:85373f1b64ed7631b50672fe14dc831cc21c12effd79fe2a84fd84a7b4151881","observation_id":"364af724-1528-4b7f-8f4d-c40ab62fefc8","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Spaceedit: Learning a unified editing space for open-domain image color editing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:55d507e7c9409c75afc87d8f0ad2d8da40fa4643b0b48ecc94e076032e607941","observation_id":"34bd99a2-15fa-48f8-aec8-20ddeae0826d","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Learning to use tools via cooperative and interactive agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:885756626faf4362732b738366751a957d3b8d18401b98898291cd7b39233c94","observation_id":"12e4b7b3-6563-4928-bb8d-5b92e1e7d86b","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"META-GUI: Towards multi-modal conversational agents on mobile GUI","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:bb51d80fc305df2ce38a797561f1f2f00d9528c5873f34d8bd6dedebdf1e71cc","observation_id":"bcee4440-1ef4-44ae-bf1f-332d1a3ec59a","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:91f4a6a6d78194067056a1b1aee17f8aa72349bea154018ebe3cb87e6bbe7eac","observation_id":"736a4a30-cdf3-4b8e-a6a3-bc09dfe859a0","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:954068e94dff7a3b0c3655b9124cea54a6a5afa9555b276247ed58ca3649bb20","observation_id":"e4d9b295-2dd9-42b3-a9be-db3710fe23c5","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.16291","doi":"10.18653/v1/2023.emnlp-main.118","metadata_source":"pith","pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","venue":"cs.AI","work_id":"ffe0d207-86cf-4742-a100-e988ac8b9676","year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b85006540fa47ee8322a4a31a21149450185593f866307a38c5f1525411bbd5d","observation_id":"889f3fbd-6169-4150-94b3-92377e48bd07","resolution":{"observed_at":"2026-07-02T20:37:22.745150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"GenArtist: Multimodal llm as an agent for unified image generation and editing.Advances in Neural Information Processing Systems, 37:128374–128395, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:1edf2c85474f6a0c8afec36f2fe59fb1305566dfcb3d1584f573a25ffe872e23","observation_id":"11899da8-9574-4f54-97a3-5b2e46e91919","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:be8725c603c8775adb4617769bb29dcf2d5c59abdc09a1270ef6e0a26189a2c5","observation_id":"c73267bc-2073-498b-b906-c9cf5822ddf2","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:46d7e17db1472c842845a49aeb4c4de0a9ab4851fb462204f6c1568370c03fea","observation_id":"b7508a97-8878-496e-986b-b8703aa0e51d","resolution":{"observed_at":"2026-07-02T20:37:22.764238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Alignment for efficient tool calling of large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:983924c82d85847240591e27db8963290745efae37579fb9849014d1f07828a6","observation_id":"5a6cc917-0964-4db4-8090-040e62a30c04","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Delusions of large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:4243dabdbc4395455d4bc5e6dd71eafb79dda25a5016a92ca20fd075b2cf4363","observation_id":"783346bf-d85d-48ce-b82e-7c1302101647","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Reducing tool hallucination via reliability alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:668180c456da7b501ca6355cc50a96f5128e46fce32433ad32153bb776dce0af","observation_id":"89c89ef7-2c19-48b9-aa86-b36106ca637c","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Inversion-free image editing with language-guided diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:4083a10db47c789529714f0532cdaad36a697468c907c032f1d274f759148595","observation_id":"68c69069-f43f-41c7-b2f1-0fb14cfc14c1","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:1d87f81b40ec09ae845637a7e8779af835601509842957f44dd3913281073fab","observation_id":"a2ebe8bd-e3eb-4088-872e-7601a2f337ac","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:465bb3683683a46ad01446769e11621d5ca9699007adc82bbf2ac80feab95340","observation_id":"b8a6b12d-2461-4477-b742-7d2d09a92640","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Craft: Customizing llms by creating and retrieving from specialized toolsets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:9cb5f9410a0d5ef7ab64f5097b87da4b8ce98f652c4402cc2bd8d252094c187c","observation_id":"099cccd6-ef55-44ac-890a-648737ffe302","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Socratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:fb09ab765411faec9df1bae1eddda27e382d75c89a780876928f0b9bc0fd8159","observation_id":"ea3e250c-5d09-4475-aef1-fe03fa6868f6","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-01T11:47:21.821212Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":"2402.07939","doi":"10.48550/arxiv.2402.07939","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ufo: A ui-focused agent for windows os interaction","venue":"arXiv (Cornell University)","work_id":"70bc896f-9c76-4f30-9b81-5ac0d58e7af3","year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:9c202605836209648c810d2162329c524c1b502c5fb560a9631915d3165c30f5","observation_id":"22f8164f-996b-4e7a-8269-282d087277b5","resolution":{"observed_at":"2026-07-02T20:37:22.762003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:03704eb923e081fd3e54b2ba3bc7ad930598b51277a0b2f2b7ea5c7d2e4339d4","observation_id":"1391b8a8-9597-4f20-bacd-6b3d809b26db","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b3854dd89c72afac55bd330db99aa8b64d1f8caadaa282903683e4ef1ae33d86","observation_id":"c1059ea3-8366-40da-9d89-c5c5d78c215c","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:bfd7b6a7eae090b06b53748fca28b3dafc206a45ac6a68ce90981437b551517f","observation_id":"c2994b04-b565-4e7b-a03a-f540c4998e92","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"ToolRerank: Adaptive and hierarchy-aware reranking for tool retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:8285058e209eb426fb4f7cfcec1f5187f37ac1b2c13bc721150123a998d27262","observation_id":"66aded7a-2ed6-4e9a-a9d6-81b0ddb1a70f","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"MobA: Multifaceted memory-enhanced adaptive planning for efficient mobile task automation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:0896bc10c3c4e4b409754c7196d606a2d9d57cbbba28dfeb7c452a9ed4c6f44f","observation_id":"f13cacf2-a6f0-4979-99f7-fe2ef9ff97b5","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"brighter but less col- orful","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:25fa03caf19c6ce0f3a6c90e5636ffbcfae19e5ecba88746e44310b0f35d3925","observation_id":"3451d65e-4aa1-4814-9c53-59d903339299","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"\"\", 3: \"","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:b14088945e95f8d4eb5dfdb1b0a916e2b7fd410ddaa2985247f9138e1e258c26","observation_id":"8d4d8b33-c6af-46b0-a055-2da166ad0537","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:d8a386b6e698b9a193c307fb96265d96f95827cc7260b2f529bb5f2c5ba2c1b6","observation_id":"d045dd79-05cf-472a-a5bc-e6e30a731c65","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:bb8c8b1b5e92e22e7f1e1fbe39f0aa16e7b9059a5fd95a9b5cb0d65d9a763013","observation_id":"a2e92da2-7b58-488c-b75f-b0457a4cc19e","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"exposure","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:67a6116ee498a5c61a2f5a17fad6233433e2d2d5c554ee275d68b6b867ee34e8","observation_id":"e6367c36-ba85-4ce0-b657-de9085964e95","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:7ef3ab7a190c9dd11db9c9f6cec52405f9c1011dbe4b591df386a44cf6a43ac0","observation_id":"ebf29bf5-e376-4ac5-bce5-b28997854721","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:3c2986fe7346737e6426f5ab79ff8ab306bf0de2f9c0fe631f7f9150aff82e68","observation_id":"aad811e9-a47a-49df-8344-400b8603d65f","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:e4f0aaa320a7119a695a1e98969ba28be4367c8085c72d491aba0b6d7356ce42","observation_id":"a2b972f0-763c-4022-89ca-8b94e1d99c96","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:a038a4f38c8fb001ef0559f2acb50e29862cb3a213e88a0f76c7ca6524901a71","observation_id":"2c5a58b5-23b6-4b7f-bcb2-82d32fa1919b","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:18:49.849794Z","title":"</think> \"\"\" System Prompt for Summary Reward You are an expert image editor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T20:18:49.849794Z"},"links":{"citing_paper":"/paper/2606.08016"},"observation_digest":"sha256:a03ce29e0acdf01073c35ed1c1365b615bb0ea206e15f253d9ffad2baee12e18","observation_id":"027ac9b3-72cb-4240-8db9-9518ba3a1ee0","resolution":{"observed_at":"2026-06-27T20:18:49.849794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08016","last_updated":"2026-06-06T07:11:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:11:08Z","title":"IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":75,"verified_exact":15,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2606.08016."}