{"as_of":"2026-08-05T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b79ed5d85204f148a6a3fa78eaf8727fd6394c4706e4b9ea01b82167d59fc1c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T18:12:01.235057Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23588/citation-record","integrity":"/paper/2607.23588/integrity","json":"/paper/2607.23588/citation-record.json","paper":"/paper/2607.23588"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:55.766093Z","title":"Claude design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:55.766093Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:76e4754d1560eb9d3d9c1108d75fd83ef4ee2ec5f67d385793e8935d91add474","observation_id":"21ea2c63-b769-4758-9ea7-433ab68aa066","resolution":{"observed_at":"2026-07-30T18:11:55.766093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-07-30T18:11:55.821375Z","title":"FLUX.1 Kontext: Flow matching for in-context image generation and editing in latent space.arXiv preprint arXiv:2506.15742, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:55.821375Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:d49e9d3638a32ae34be7f3dc1e3a413bfa53f19819397f9e3f21789313bcbb77","observation_id":"cd86e9c6-02f6-4636-8b18-ce4a899f0adf","resolution":{"observed_at":"2026-07-30T18:11:55.821375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:55.940278Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:55.940278Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:0969b33a913d9b9b26d590842908ba454b2e79dcdde408f5a183604c6f8f6d36","observation_id":"6f371a22-9669-4d16-b0f1-0282e6f2c60d","resolution":{"observed_at":"2026-07-30T18:11:55.940278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:56.063095Z","title":"Seedream 5.0 Lite","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.063095Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:6e13f4a3143dac81ca8eb9ef039ed852614deee65bc784ff193bcf2d1f095c51","observation_id":"979b85a9-1103-41cc-9cdc-a0376b93a12b","resolution":{"observed_at":"2026-07-30T18:11:56.063095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23130","last_updated":"2025-05-29T06:00:51Z","snapshot_observed_at":"2026-07-06T21:32:43.441417Z","submitted_at":"2025-05-29T06:00:51Z","title":"PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23130","snapshot_observed_at":"2026-07-30T18:11:56.188903Z","title":"Photoartagent: Intelligent photo retouching with language model-based artist agents.arXiv preprint arXiv:2505.23130, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.188903Z"},"links":{"cited_paper":"/paper/2505.23130","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:4c2b49b5ece8853b4d269c703a468b7c454a6e99102eb7fbc42baf57e0873882","observation_id":"26d42d83-6d93-404c-a81e-263ce44c7f93","resolution":{"observed_at":"2026-07-30T18:11:56.188903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:56.309493Z","title":"Unify-agent: A unified multimodal agent for world-grounded image synthesis.arXiv preprint arXiv:2603.29620, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.309493Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:dc3b472145f0ff2d362b6134c7e6528c59929408ed84110b746ec9f178e91e7c","observation_id":"7ed4222a-a15a-417f-9dee-f4f4c4b073c7","resolution":{"observed_at":"2026-07-30T18:11:56.309493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10741","last_updated":"2025-06-12T14:28:12Z","snapshot_observed_at":"2026-07-06T21:41:04.748241Z","submitted_at":"2025-06-12T14:28:12Z","title":"PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10741","snapshot_observed_at":"2026-07-30T18:11:56.433952Z","title":"Postercraft: Rethinking high-quality aesthetic poster generation in a unified framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.433952Z"},"links":{"cited_paper":"/paper/2506.10741","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:a370804acf69e634981c21845b4a8dc43b99c089b1ee6c1ac441c55725968672","observation_id":"1cb04005-c1fd-4aa0-af9d-d64afbbb2533","resolution":{"observed_at":"2026-07-30T18:11:56.433952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21605","snapshot_observed_at":"2026-07-30T18:11:56.550690Z","title":"Genevolve: Self-evolving image generation agents via tool-orchestrated visual experience distillation.arXiv preprint arXiv:2605.21605, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.550690Z"},"links":{"cited_paper":"/paper/2605.21605","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:211c75f20dfa7692ddcbcd2c0b650758c40d5147fee7318516bd3c4db06ef547","observation_id":"8542a092-b4c0-44b0-b3e9-aebd46e21b88","resolution":{"observed_at":"2026-07-30T18:11:56.550690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-30T18:11:56.665887Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.665887Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:58f09c77ea58e904f80e271c18c0ca578859f99b543b23d054995a1dfdd97ee1","observation_id":"37e624cd-d920-4eb3-b233-9aa7d5a5ad18","resolution":{"observed_at":"2026-07-30T18:11:56.665887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-07-30T18:11:56.784415Z","title":"Kimi-audio technical report.arXiv preprint arXiv:2504.18425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.784415Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:c12781328bc7ecbb2fb2d94f4ad6cef5f9a1927556aeb682b3d613851fe90256","observation_id":"44f46cfe-0750-4c24-b165-f68bacaf0d47","resolution":{"observed_at":"2026-07-30T18:11:56.784415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:56.904633Z","title":"MonetGPT: Solving puzzles enhances MLLMs’ image retouching skills.ACM Transactions on Graphics, 44(4):1–12, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:56.904633Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:6e27b3dbb2db226b29665a5f78350678670c2faee575a238d8a085c7f2cde740","observation_id":"3a19b9ec-dd19-4685-9e33-8efe744cbeae","resolution":{"observed_at":"2026-07-30T18:11:56.904633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28767","snapshot_observed_at":"2026-07-30T18:11:57.022662Z","title":"Gen-searcher: Reinforcing agentic search for image generation.arXiv preprint arXiv:2603.28767, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.022662Z"},"links":{"cited_paper":"/paper/2603.28767","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:efe7ee0e1c0613eb447b1afb0c78feebe063e1c21b708af21878880cbf84290a","observation_id":"a42c2564-ae86-47bc-b4d0-73937b5c0289","resolution":{"observed_at":"2026-07-30T18:11:57.022662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:57.162269Z","title":"Guiding instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.162269Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:8e31fcf9943de52644b0a8a3089f7aba28df0524da632391e7c7197d3e861e91","observation_id":"d99da952-6288-4f1a-a1fb-a78f0ec2f0e2","resolution":{"observed_at":"2026-07-30T18:11:57.162269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01619","last_updated":"2025-03-03T14:54:01Z","snapshot_observed_at":"2026-08-02T16:05:54.843255Z","submitted_at":"2025-03-03T14:54:01Z","title":"Advancing vision-language models in front-end development via data synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01619","snapshot_observed_at":"2026-07-30T18:11:57.328467Z","title":"Advancing vision-language models in front-end development via data synthesis.arXiv preprint arXiv:2503.01619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.328467Z"},"links":{"cited_paper":"/paper/2503.01619","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:0feb0fdff9f0eea228d53e9d0e4b5388fda8736df2feb787acd05f2082e55523","observation_id":"058d0f09-92b1-4fb7-a294-2207015ccb66","resolution":{"observed_at":"2026-07-30T18:11:57.328467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:57.430533Z","title":"Gemini 3.1 Pro Model Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.430533Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:3432a9e217bbd1b167d26f9b846e25cdc0b5eb3f32851f478c09bfc66e14e028","observation_id":"ae5280a9-57cb-4062-818e-b74362d592e6","resolution":{"observed_at":"2026-07-30T18:11:57.430533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:57.579067Z","title":"Gemini 3.1 Flash Image Preview","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.579067Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:501886b08a43f71e1812379c6cc063ff44f1e4ef74578aaf84357ccf139ad6fd","observation_id":"c156b2f4-be16-4c3e-b887-a1da8e1b8344","resolution":{"observed_at":"2026-07-30T18:11:57.579067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.26648","last_updated":"2026-07-20T07:35:15Z","snapshot_observed_at":"2026-08-04T14:33:11.924362Z","submitted_at":"2026-03-27T17:50:45Z","title":"Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.26648","snapshot_observed_at":"2026-07-30T18:11:57.745081Z","title":"Vision2web: A hierarchical benchmark for visual website development with agent verification.arXiv preprint arXiv:2603.26648, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.745081Z"},"links":{"cited_paper":"/paper/2603.26648","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:0dc2d4382687978729f5adf07532bc0cc0b65d8b6a17c2fbf90df33d7deb7598","observation_id":"d8c797ee-b6f2-46bc-a662-ed1b2b2fe421","resolution":{"observed_at":"2026-07-30T18:11:57.745081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:57.911212Z","title":"ComfyGPT: A self-optimizing multi-agent system for comprehensive ComfyUI workflow generation.arXiv preprint arXiv:2503.17671, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:57.911212Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:b44b7abfb8405d0e46e1ab5fb489408d198fc1ba3eccb5e530571327b72260f3","observation_id":"8a944490-009a-4f5f-a037-58f3d819745b","resolution":{"observed_at":"2026-07-30T18:11:57.911212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-07-30T18:11:58.077397Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing.arXiv preprint arXiv:2404.09990, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.077397Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:614abc223e9f2e2c65290a702b5e5bb33bb4a4319f4ad3ad52b5e065480a556a","observation_id":"db7a25dc-37d6-4961-94f6-a85ebf4cbc0e","resolution":{"observed_at":"2026-07-30T18:11:58.077397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.222414Z","title":"Node-based editing for multimodal generation of text, audio, image, and video.arXiv preprint arXiv:2511.03227, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.222414Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:121d17a669e60f4850b3b5679773744bb2028e73ab7e800ca50916e8986a66bc","observation_id":"40985152-0e6e-4b6b-b772-80eace24448f","resolution":{"observed_at":"2026-07-30T18:11:58.222414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.307788Z","title":"StoryNodes: Human-AI co-creation for multimodal media generation using an agentic node-based interface","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.307788Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:2db5dec35fad0230331605ba806caaba31ee018f1a9e11f2ccc496c00e33d6f0","observation_id":"fbe66ef7-d5d0-4a28-a05d-28d380f4ebff","resolution":{"observed_at":"2026-07-30T18:11:58.307788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.367536Z","title":"Stitch: A new way to design user interfaces using ai.https://blog.google/innovation-and-ai/ models-and-research/google-labs/stitch-ai-ui-design/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.367536Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:999a42a5c8810d35efb1ff1cc14fc35af252515f4a0ae334450596bb51c9d7a9","observation_id":"03a9f316-3538-4abd-988c-a9f591c49e52","resolution":{"observed_at":"2026-07-30T18:11:58.367536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-07-06T17:44:21.659847Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-07-30T18:11:58.456621Z","title":"Unlocking the conversion of web screenshots into html code with the websight dataset.arXiv preprint arXiv:2403.09029, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.456621Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:4af0feae10528f0356f229cb740747a0e57d550c3ba5cda88cc9f64030aa565e","observation_id":"aae6c768-67e6-4c26-a3af-86f203b8247a","resolution":{"observed_at":"2026-07-30T18:11:58.456621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09213","last_updated":"2024-06-05T20:59:27Z","snapshot_observed_at":"2026-07-06T16:48:05.271182Z","submitted_at":"2023-11-15T18:55:45Z","title":"GENEVA: GENErating and Visualizing branching narratives using LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09213","snapshot_observed_at":"2026-07-30T18:11:58.521121Z","title":"GENEVA: GENErating and visualizing branching narratives using LLMs.arXiv preprint arXiv:2311.09213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.521121Z"},"links":{"cited_paper":"/paper/2311.09213","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:f5e1c9853c18654ee88aa58d0fb34a3f99fbee91254fc89c5adaf062070f5f94","observation_id":"8f64374c-0e29-456a-a649-1e6ef6df9098","resolution":{"observed_at":"2026-07-30T18:11:58.521121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28139","last_updated":"2026-05-01T09:39:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T17:23:19Z","title":"Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.28139","snapshot_observed_at":"2026-07-30T18:11:58.595774Z","title":"Claw-eval-live: A live agent benchmark for evolving real-world workflows.arXiv preprint arXiv:2604.28139, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.595774Z"},"links":{"cited_paper":"/paper/2604.28139","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:1e0795d410e15e0c58cce369bbbdf139577356eac9b7f9a4a1be3f0c3ef2eb88","observation_id":"34531799-0305-48b4-b461-7dcbccfb4e84","resolution":{"observed_at":"2026-07-30T18:11:58.595774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.688998Z","title":"Libtv skills.https://github.com/libtv-labs/libtv-skills, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.688998Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:585dc004fbcbd244f8365ed9bda76b585821fcaa62ba2de3e108b355f552d475","observation_id":"9aaff17b-9009-463c-9c75-e0be667817ad","resolution":{"observed_at":"2026-07-30T18:11:58.688998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17612","last_updated":"2025-06-21T06:36:00Z","snapshot_observed_at":"2026-07-06T21:45:38.424177Z","submitted_at":"2025-06-21T06:36:00Z","title":"JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17612","snapshot_observed_at":"2026-07-30T18:11:58.736145Z","title":"Jarvisart: Liberating human artistic creativity via an intelligent photo retouching agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.736145Z"},"links":{"cited_paper":"/paper/2506.17612","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:34cc89a44b671a9b6eedca7696b1d2dc8fcae3b4a7012dd3a176bd238da222bd","observation_id":"4b154fe1-d545-4072-9131-2c0d5c10df58","resolution":{"observed_at":"2026-07-30T18:11:58.736145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.781908Z","title":"Jarvisevo: Towards a self-evolving photo editing agent with synergistic editor-evaluator optimization.arXiv preprint arXiv:2511.23002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.781908Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:7e5f6a1e568ea18efd580a8c72b74df5d2679bdd5613723f9bfdb76f5b14864a","observation_id":"a6ce469a-ed6b-4aad-a94d-ce4f2764537d","resolution":{"observed_at":"2026-07-30T18:11:58.781908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-30T18:11:58.832877Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.832877Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:a8e2ab6bc29a85ff042a023dbb01dad01aa9aad99efad36215c0bc4811ac2e34","observation_id":"539ba8ad-04d3-4935-b663-52fa5d49abb4","resolution":{"observed_at":"2026-07-30T18:11:58.832877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:58.894339Z","title":"Minimax hub.https://hub.minimax.io/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.894339Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:503619a0272f8338ad6ffc06558ca3c48cc616c22fda0b798dee61d829463784","observation_id":"11d60bbc-73de-4819-81ed-5ef01e1afb68","resolution":{"observed_at":"2026-07-30T18:11:58.894339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22358","last_updated":"2025-07-30T03:49:14Z","snapshot_observed_at":"2026-07-06T22:04:58.510840Z","submitted_at":"2025-07-30T03:49:14Z","title":"Magentic-UI: Towards Human-in-the-loop Agentic Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22358","snapshot_observed_at":"2026-07-30T18:11:58.917187Z","title":"Magentic-UI: Towards human-in-the-loop agentic systems.arXiv preprint arXiv:2507.22358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:58.917187Z"},"links":{"cited_paper":"/paper/2507.22358","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:ca2776dd7663a4ecd2f4cb93fd323435ede5655b480a1bf41a2fb235a69817b9","observation_id":"e32f5fc7-b003-4762-aef0-4b8dfbee8309","resolution":{"observed_at":"2026-07-30T18:11:58.917187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:59.022066Z","title":"GPT-5.5 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.022066Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:df37dda2b976b388e4ee849b2573705db08fbeb94a1cd8692bf9d3849271ebab","observation_id":"676fe693-835b-4eff-9247-03065bb364e3","resolution":{"observed_at":"2026-07-30T18:11:59.022066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:59.213291Z","title":"GPT Image 2","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.213291Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:49cbbfcb339189bb9a2f3f9e48759e8dfe7d94697cae362ae492c0e72d8912b9","observation_id":"d491df65-7c0b-4995-a504-8b9adcf8c54c","resolution":{"observed_at":"2026-07-30T18:11:59.213291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-30T18:11:59.404060Z","title":"Hierarchical text-conditional image generation with CLIP latents.arXiv preprint arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.404060Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:69cd8a84c13b12d8ef6436c6d9b5c6a989b0cd5bd29cdc202ad2225faa1162ed","observation_id":"720708b6-5cb8-43d4-a462-76d119c287f4","resolution":{"observed_at":"2026-07-30T18:11:59.404060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12688","last_updated":"2023-07-21T18:13:10Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T06:37:35Z","title":"Dynamic Storyboard Generation in an Engine-based Virtual Environment for Video Production","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12688","snapshot_observed_at":"2026-07-30T18:11:59.521115Z","title":"Dynamic story- board generation in an engine-based virtual environment for video production.arXiv preprint arXiv:2301.12688, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.521115Z"},"links":{"cited_paper":"/paper/2301.12688","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:be3771d79579b088ecb05dff304c03ba7f5544fcae90aaca4176fd27606f3812","observation_id":"cd4e249d-0015-47ad-8ad3-ab3fb2d2f8ad","resolution":{"observed_at":"2026-07-30T18:11:59.521115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:59.617080Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.617080Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:0f6f6fc52663f41647c627af5a026ec337c94e49d82a70c98c6ff789059e0c96","observation_id":"60b2647d-3915-4a57-8b98-3a0c93205878","resolution":{"observed_at":"2026-07-30T18:11:59.617080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-07-30T18:11:59.621120Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.arXiv preprint arXiv:2205.11487, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.621120Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:26dd68847981b671a714aa16dc7db3620ed7a7eb20b12176cda3a141ed3c41ca","observation_id":"49794ce4-c0b7-4e0a-9b08-0785327263e4","resolution":{"observed_at":"2026-07-30T18:11:59.621120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-30T18:11:59.668552Z","title":"Seedream 4.0: Toward next-generation multimodal image generation.arXiv preprint arXiv:2509.20427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.668552Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:6eb56f2b6da18d838d92a2ea04d82faf4da06858d88972e656c2d1d79b2116e4","observation_id":"6878d94b-bcd2-4992-a3e1-371bb99b03dc","resolution":{"observed_at":"2026-07-30T18:11:59.668552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:59.809001Z","title":"Design2code: Benchmarking multimodal code generation for automated front-end engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.809001Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:b7b88badffcf8669eddd3ab0015047c5d148c8e7cf61bc286e011bd414773cc3","observation_id":"8d09ca1d-8cea-451c-b3d1-ad53c360101e","resolution":{"observed_at":"2026-07-30T18:11:59.809001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:11:59.982896Z","title":"Tapnow ai creative platform documentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T18:11:59.982896Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:0c09fe7d15646958c2306a2f4e9ef4910d238f20a698815ad9be3487a2e6c74e","observation_id":"6efc636a-e35c-4f9c-89ae-5438206cfdbb","resolution":{"observed_at":"2026-07-30T18:11:59.982896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-07-30T18:12:00.088705Z","title":"Seedance 2.0: Advancing video generation for world complexity.arXiv preprint arXiv:2604.14148, 2026.https://arxiv.org/ abs/2604.14148","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.088705Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:c3ee6d25ba36a5eabe5d1717b4c8c84de9812df72aa683f686a87d23eca8f384","observation_id":"c157b6c6-1a0e-4025-947e-c8fdd252402b","resolution":{"observed_at":"2026-07-30T18:12:00.088705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10708","last_updated":"2026-04-26T21:06:11Z","snapshot_observed_at":"2026-08-02T07:50:40.921545Z","submitted_at":"2026-04-12T16:08:20Z","title":"Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10708","snapshot_observed_at":"2026-07-30T18:12:00.209282Z","title":"Audio-omni: Extending multi-modal understanding to versatile audio generation and editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.209282Z"},"links":{"cited_paper":"/paper/2604.10708","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:5b28c76ec15e4f9dd66ce4bd585d6ff7470a66d896e9e271bac9c40e722139ce","observation_id":"6c8e2f5a-5045-4b3d-a715-fb1d5753f5d3","resolution":{"observed_at":"2026-07-30T18:12:00.209282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-30T18:12:00.311201Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.311201Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:6741a0e740852aafa3d1483e53ef827d4d8779b6c87ad8d569a464981bbe84f5","observation_id":"5b54d182-01d6-411e-a9c3-a08d3f6b1a63","resolution":{"observed_at":"2026-07-30T18:12:00.311201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:12:00.466983Z","title":"PromptChainer: Chaining large language model prompts through visual programming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.466983Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:eb9bbe91e2b5fbb6002cd0a750dc452b3952b72e07c2b3f029805b991bceab49","observation_id":"37cd124a-ae18-4090-aa2f-695e12154fd7","resolution":{"observed_at":"2026-07-30T18:12:00.466983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-07-30T18:12:00.567686Z","title":"Omnigen: Unified image generation.arXiv preprint arXiv:2409.11340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.567686Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:e6ff061cc5102ef4f9f2c694cb233bf361030d76c61d4b9a17684ff76d68a9b9","observation_id":"6237bb20-3860-4477-8552-2da13e6cf190","resolution":{"observed_at":"2026-07-30T18:12:00.567686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-07-30T18:12:00.656802Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.656802Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:705446568db1b58e1e72c6afd84907dede205617476ffc554a4ca4324d98e6a6","observation_id":"9b5ac9f8-6b9b-466d-9092-05d312e031be","resolution":{"observed_at":"2026-07-30T18:12:00.656802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09790","last_updated":"2025-06-11T14:35:15Z","snapshot_observed_at":"2026-07-06T21:40:26.217708Z","submitted_at":"2025-06-11T14:35:15Z","title":"ComfyUI-R1: Exploring Reasoning Models for Workflow Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09790","snapshot_observed_at":"2026-07-30T18:12:00.760876Z","title":"ComfyUI-R1: Exploring reasoning models for workflow generation.arXiv preprint arXiv:2506.09790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.760876Z"},"links":{"cited_paper":"/paper/2506.09790","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:b39986865a4cbb16af2329536265376ca7351b18fad480343ce99a36c1b6a7b9","observation_id":"698f80f4-da27-4cb7-8042-717c544608a2","resolution":{"observed_at":"2026-07-30T18:12:00.760876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:12:00.863447Z","title":"ComfyUI-Copilot: An intelligent assistant for automated workflow development","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.863447Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:4a0b62e5ce9fc0d2e6dfdeddfdbbf5ebf0f677f7e9e96e7ddc1263c1ac0181d6","observation_id":"7629497d-923e-4c8e-8544-ee70bfafe077","resolution":{"observed_at":"2026-07-30T18:12:00.863447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:12:00.966317Z","title":"ComfyBench: Benchmarking LLM-based agents in ComfyUI for autonomously designing collaborative AI systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:00.966317Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:7ff68a4b1050173bb0d73d197f0818ef4543d6645b92b74414ae7a338dea4a29","observation_id":"80705135-ee9b-486f-874d-24b9e08188f2","resolution":{"observed_at":"2026-07-30T18:12:00.966317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-07-30T18:12:01.025913Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:01.025913Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:92f1a3dfe4c7d1a2d9aff7530d22a1a55a7b427f11b3b714d2b64bc02b556e25","observation_id":"f0f2b316-81ac-4709-be89-890e94c9ae8d","resolution":{"observed_at":"2026-07-30T18:12:01.025913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:12:01.102433Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:01.102433Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:00de4e924e8f3fd5333b18bb0033863d4b9c73f73ad019994831924387ae787e","observation_id":"620c4fd8-93c1-4ec2-84a6-bc0ae413d493","resolution":{"observed_at":"2026-07-30T18:12:01.102433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T18:12:01.235057Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Processing Systems, 37:3058–3093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-30T18:12:01.235057Z"},"links":{"citing_paper":"/paper/2607.23588"},"observation_digest":"sha256:20d8a6eaf487452e322e7a7c21934f94231c0ad7a61b8162eeb93bed33030d0c","observation_id":"75620615-899e-4220-bdda-5be7a7d02b66","resolution":{"observed_at":"2026-07-30T18:12:01.235057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23588","last_updated":"2026-07-26T10:36:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T14:37:21.741552Z","submitted_at":"2026-07-26T10:36:24Z","title":"JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.23588."}