{"as_of":"2026-08-08T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de56a00f419b021086e69189ada2ae4c75770f91330e7e3723e2b0cb7f1c64b2","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:42.242811Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T11:01:35.324580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09910","snapshot_observed_at":"2026-07-13T11:01:35.324580Z","title":"Igd: Instructional graphic design with multimodal layer generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04192","last_updated":"2026-04-07T16:58:37Z","snapshot_observed_at":"2026-08-03T14:38:13.612615Z","submitted_at":"2026-04-05T17:20:08Z","title":"Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T11:01:35.324580Z"},"links":{"cited_paper":"/paper/2507.09910","citing_paper":"/paper/2604.04192"},"observation_digest":"sha256:489c60893540c5b5479f5e95c57df5d7ef6c9ed00ab2c1cf89f37f0bb824e9aa","observation_id":"5298d330-c62b-4909-82ab-65f92a3c9499","resolution":{"observed_at":"2026-07-13T11:01:35.324580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09910/citation-record","integrity":"/paper/2507.09910/integrity","json":"/paper/2507.09910/citation-record.json","paper":"/paper/2507.09910"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.238953Z","title":null,"venue":null,"work_id":"2977dd46-8c2e-46fd-af0e-d33b343afc42","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.863278Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:8046ad98a59fb375ddc7b8814b40910daa95d95f2dc39c459d61bb620a6a5f4f","observation_id":"a4e54592-735e-4b61-977b-0fe01082064d","resolution":{"observed_at":"2026-08-06T17:47:43.243860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.220106Z","title":null,"venue":null,"work_id":"2e1bf1e5-02f2-4f33-96b3-df9c84858666","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.870086Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:35549f792750e6758b5440d0a3861b0082ed05a1f732190bac6af0178a4b28fb","observation_id":"3c4fa836-310e-400e-ab99-fbd0a875cea8","resolution":{"observed_at":"2026-08-06T17:47:43.224866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:47:41.878400Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.878400Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:20b357fbd563f1093529428146dff7444bdf5e16d53eb8adc71c7cbd9e02c449","observation_id":"6e88a922-1f40-4fe7-8189-52ea1204f035","resolution":{"observed_at":"2026-08-06T17:47:41.878400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.884469Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.884469Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:cb32c27cf93acca3fc57bc418060b87448740773d394f2de9fc2b675b321b731","observation_id":"a5086db3-5d58-4a34-a95b-82559296c4ee","resolution":{"observed_at":"2026-08-06T17:47:41.884469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.194576Z","title":"Variational transformer networks for layout generation","venue":null,"work_id":"2a3c7c67-ae6c-4f64-bb54-3b0e3f8980be","year":2021},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.889936Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:de9319ef689e1d4c35d72728fde21578ce0bf39d2b5998e950c751c202d0b6b3","observation_id":"919c5d69-ec93-42ef-9cbf-c8e0a860fb12","resolution":{"observed_at":"2026-08-06T17:47:43.198889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T17:47:41.894526Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.894526Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:47b9a189feee60690eb46d47f88b0100da29824b13f31634fff7cd904f73d002","observation_id":"733f5543-a6eb-44d6-847f-688b5b187373","resolution":{"observed_at":"2026-08-06T17:47:41.894526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:47:41.899765Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.899765Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:827a881bb69945be586a1889a1aafe85398c4947e0638a170d6a916ffc2e0c48","observation_id":"5b2bc7a1-9ebf-4326-b4b4-f3a163d66eac","resolution":{"observed_at":"2026-08-06T17:47:41.899765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T17:47:41.908874Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.908874Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d66e301478abd929fe6b78c68e432be2f6224652f96f4c30e69893b1026f6713","observation_id":"445a8dba-1b05-4cba-a628-2d456a35a3c4","resolution":{"observed_at":"2026-08-06T17:47:41.908874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.178562Z","title":"Improving image generation with better captions","venue":null,"work_id":"7c3e113a-1c9a-408c-b9a2-5b38c7a75944","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.915784Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:5ec1a3968f09c9ec65955307280b56aabc9373a5899ad5acf9cf4f7b3f98974e","observation_id":"c224a429-d1c4-4f99-aab7-e75314fdc53a","resolution":{"observed_at":"2026-08-06T17:47:43.184028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.164716Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"1775da00-3af7-4719-a81d-ca0f308a8924","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.924619Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:95901b2938fbd051090ebc8311247f0679756a354957c02674c48671b9d726c6","observation_id":"74a07166-c16f-402d-b723-a1414da3285e","resolution":{"observed_at":"2026-08-06T17:47:43.168793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14368","last_updated":"2024-04-22T17:20:38Z","snapshot_observed_at":"2026-08-07T22:11:52.590280Z","submitted_at":"2024-04-22T17:20:38Z","title":"Graphic Design with Large Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14368","snapshot_observed_at":"2026-08-06T17:47:41.931816Z","title":"Graphic design with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.931816Z"},"links":{"cited_paper":"/paper/2404.14368","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:bbfc134f0beaddbbb670053e1d898327542c28519c42d0f9b3db6676db3c689d","observation_id":"31929ebe-cb4e-4b4b-a9f3-294e446b3fd9","resolution":{"observed_at":"2026-08-06T17:47:41.931816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.941981Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.941981Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c6ecb9a6b4164659a4908d50ac38cede1b3fceb0b952ab2bc2ff52ad1fa5ec52","observation_id":"70155036-c6ca-4475-8b94-2042b36a02b2","resolution":{"observed_at":"2026-08-06T17:47:41.941981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-06T17:47:41.947691Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.947691Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:159a252357739da0c735eb49b31ea7652f34a1bd188b0b7fadc99a764c37a87e","observation_id":"cf6090df-98ed-4ee5-ad71-6b3591a22ea3","resolution":{"observed_at":"2026-08-06T17:47:41.947691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.139874Z","title":"SVTR: scene text recognition with a single visual model","venue":null,"work_id":"ba3ab87c-4787-431d-a4d8-240adb9bd0e9","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.956111Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:93bda554b737a0f0f097580555e1b75ca5c61d54d0dff7468516ab0896077d5e","observation_id":"3b794eb6-5fad-440b-8743-27aa6c1f2f3e","resolution":{"observed_at":"2026-08-06T17:47:43.144154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.125508Z","title":"Instruction-guided scene text recognition","venue":null,"work_id":"6ed70602-f31c-4d5c-a8c9-59798680b4df","year":2025},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.963491Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:910c31c5f7181f074488aeb1579fa4dc58e3ad6e898b60694e5123a93ac5b938","observation_id":"e1541148-cc24-480e-9540-a48ea2b0d4de","resolution":{"observed_at":"2026-08-06T17:47:43.129948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.109799Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"f9e3bc4f-ae72-4b97-af3d-bc6907144918","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.968074Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:e7a78bc048fe86b95731473c45f8e7cac45f94d57f8ad225cda9ab734498d6e0","observation_id":"46609264-79a7-4edd-90d7-b7d7ba357821","resolution":{"observed_at":"2026-08-06T17:47:43.114389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:41.973122Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.973122Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:69f521ac900f88ad2ea37dea1cc74339b49130995f7dfaabbb1753d0d0effa4d","observation_id":"b5e7c1be-e26b-4f77-af65-067c569573de","resolution":{"observed_at":"2026-08-06T17:47:41.973122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-06T17:47:41.979247Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.979247Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:b372903c836416cb1ba8a176a4f755dc2a0662aae4665e816cce20ead3842ce0","observation_id":"05fce673-ba5d-4366-9c62-e29eeb872097","resolution":{"observed_at":"2026-08-06T17:47:41.979247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T17:47:41.985558Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.985558Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:dcf2e4e770f8a79e0fa80d952cea0a0c1e2776e9cab7cb61dae09eb8bcd4a553","observation_id":"88ca3cc1-fbc8-423e-9d9e-217e944030c2","resolution":{"observed_at":"2026-08-06T17:47:41.985558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.083905Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"f1282da4-037b-4714-a46e-f89505209349","year":2020},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.993765Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:cb48b2a7151a44a11a035622b401cb66e22af25a1b74143fa6da74ea09d82603","observation_id":"18edc930-1f67-4b6d-b9eb-fbcf9bcd0b3f","resolution":{"observed_at":"2026-08-06T17:47:43.088348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.067999Z","title":"Opencole: Towards reproducible automatic graphic design generation","venue":null,"work_id":"c4e01733-1f01-451b-9dd0-26b841647c1e","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:41.999236Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d581df1cf17dce550c72fad4261f975992ece3562dd195d0de4826cb32c58429","observation_id":"dc38da2c-88b1-4629-8e91-e807231aba34","resolution":{"observed_at":"2026-08-06T17:47:43.073239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16974","last_updated":"2024-03-18T21:43:20Z","snapshot_observed_at":"2026-08-07T22:13:56.773213Z","submitted_at":"2023-11-28T17:22:17Z","title":"COLE: A Hierarchical Generation Framework for Multi-Layered and Editable Graphic Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16974","snapshot_observed_at":"2026-08-06T17:47:42.004083Z","title":"Cole: A hierarchical generation frame- work for multi-layered and editable graphic design","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.004083Z"},"links":{"cited_paper":"/paper/2311.16974","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:ab1d5d57f6497cb75371a84cf19852b61546392cc7ed596c91577cffe637ef99","observation_id":"babf702b-01fb-4cd0-87d8-e236593b5333","resolution":{"observed_at":"2026-08-06T17:47:42.004083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.013451Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.013451Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:498c7469dd7f2f2cd7b5263aa130cfa9f9a0407d61cf676ad2fbe2f63d28fba7","observation_id":"096a90b3-fda0-4ac3-8022-32059becb0ee","resolution":{"observed_at":"2026-08-06T17:47:42.013451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.040560Z","title":"Autoposter: A highly automatic and content-aware design system for ad- vertising poster generation","venue":null,"work_id":"a53a834a-2f4f-4e90-b172-a66b9110a888","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.019100Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:8f73db5f108cdb2408ce0cf0068ec4a785d3713f9eaaf569366a93c178764746","observation_id":"fd0d7816-3cff-464b-9dfe-d78b4ff9b31e","resolution":{"observed_at":"2026-08-06T17:47:43.045116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-06T17:47:42.024222Z","title":"Character-aware models improve visual text rendering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.024222Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:7f06fb3489d6dddffddfa3aef84bd65a4efb3551e1e525eb4ceb80dc08e52d95","observation_id":"b2704528-4dfe-49f8-9cd7-40541872ba29","resolution":{"observed_at":"2026-08-06T17:47:42.024222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.025983Z","title":"Glyph-byt5: A customized text encoder for accurate visual text rendering","venue":null,"work_id":"add839fc-0053-40e7-aa43-51e1b654c8e8","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.030050Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:1193c1dd5ec7607f06b634e5b83f3449ca78daa5c4dbd2a8f1c90e148c0cf5d0","observation_id":"fa96d78e-d396-496c-a62a-441f87825ca6","resolution":{"observed_at":"2026-08-06T17:47:43.030779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-07T22:11:51.398507Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-08-06T17:47:42.036151Z","title":"Glyphdraw: Learning to draw chinese characters in image synthesis models coher- ently","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.036151Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:927695b33b24476dbd1b31746a110b0222cb14a248a73eec1c25737b80da7c83","observation_id":"2ddcc802-8b17-4f34-9de4-ece4572caa94","resolution":{"observed_at":"2026-08-06T17:47:42.036151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:43.011146Z","title":"Novelai improvements on stable diffusion, 2023","venue":null,"work_id":"6c310afe-7d05-4fd5-b503-b1381bec75c8","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.043255Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:ec04c5f411a6c24c28a78d0a6373e4f7dc1c965d7ab438583410d78771fec60d","observation_id":"d788e3b7-32e8-4ea4-87dc-b8b1ee0aff3b","resolution":{"observed_at":"2026-08-06T17:47:43.015767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T17:47:42.051268Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.051268Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c43a67a56218cabbe07552e669e43114ff22803b20460a10d6574b4af111e5cb","observation_id":"aff5b46b-fcc3-45f6-a307-41ff1fd70512","resolution":{"observed_at":"2026-08-06T17:47:42.051268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.996563Z","title":"Boosting semi- supervised scene text recognition via viewing and summariz- ing","venue":null,"work_id":"89386910-8751-416c-b0e7-f4da8b2a0b88","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.058715Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d93f4e909bfcdc0c3634d779257cbed7e024e9cce872e120b744c1f9a1e03f2f","observation_id":"e4bded86-80e2-403f-9a71-759394563fce","resolution":{"observed_at":"2026-08-06T17:47:43.001415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.067377Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.067377Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c232845eb2054d853a957356d1d12817bb84c6e1bdc7c2e8599711e4a89f4aa3","observation_id":"91da3966-957b-4d08-b220-6b5504d921de","resolution":{"observed_at":"2026-08-06T17:47:42.067377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.074676Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.074676Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c73338e3ce2308cd99db4321958d4cd13e9b4d051519a564c84bb07ec2d8dadd","observation_id":"3be1c975-559e-47fa-9d17-8118c74d5379","resolution":{"observed_at":"2026-08-06T17:47:42.074676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.961804Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a0ad0340-f1b7-4287-8b65-217b0172b6cc","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.080604Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:7d3275ea7b99730d28a85ab7f6a2f006e4a31770822e91b1c675c51050456d30","observation_id":"bb8ce54d-b144-4f0d-8dce-04bf941c641e","resolution":{"observed_at":"2026-08-06T17:47:42.966745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.947712Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"7b5f7379-b6e6-4237-b362-9bcf8d7c8594","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.086926Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:7811f8c08fb7ea3e4efdc1f670776d87ab8dcc73aced6f50e887960bb093d422","observation_id":"f167a077-312d-4a70-a80e-e7cd79108757","resolution":{"observed_at":"2026-08-06T17:47:42.952023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.932485Z","title":"Potrace: a polygon-based tracing algorithm,","venue":null,"work_id":"9b19bc0e-6740-46f9-8d20-b806535a25fa","year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.096229Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:32bc10682f3bad109427bfde69cec055c4f4fb39c990ea020db9ab52d7689d6c","observation_id":"b47c8be5-9084-4c27-a0e5-a4c037ba4327","resolution":{"observed_at":"2026-08-06T17:47:42.936592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T17:47:42.108931Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.108931Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:9e559a0e64d5b12506ae7133c261e0a528ef56c5dcdeea4fe5af63cd8c21e163","observation_id":"415d539d-9c43-4796-8eee-dca08f895b24","resolution":{"observed_at":"2026-08-06T17:47:42.108931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.918236Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"5084e5a6-ca09-4f96-8ce3-891c5acb309e","year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.116688Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:aa41b26d7be4c2da0beb0b2b2796318cc5a258764c8116741a89a7d2391d0b3e","observation_id":"21956ea7-c28a-42f7-863f-f05cb26a2042","resolution":{"observed_at":"2026-08-06T17:47:42.922603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T17:47:42.124987Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.124987Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:65666f3185c0d13716983f1e2d08b2b255dd95b99d63a088d56b4c2138ccf711","observation_id":"f82b1e0f-c223-43c8-881a-3f9ee12d6e47","resolution":{"observed_at":"2026-08-06T17:47:42.124987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:47:42.130015Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.130015Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:bd4064d5ecc0f606e4347c3b6707a039e669354e07f20e8ebce312329fba59fe","observation_id":"42d2d490-4099-47d5-bd80-5866f4bce8a6","resolution":{"observed_at":"2026-08-06T17:47:42.130015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-07T22:13:54.617491Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-08-06T17:47:42.136102Z","title":"Anytext: Multilingual visual text gen- eration and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.136102Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:e446badb6c3c86341927762e80822d054d2b973c934b6de06913d8863c495cdf","observation_id":"4f180de3-5e9d-43a7-9968-a0d7f54a9c4d","resolution":{"observed_at":"2026-08-06T17:47:42.136102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.141183Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.141183Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:fa6752338cc2d6ac425d9b0187ef07a624c4201300afd33a5c82dcf02aa7208d","observation_id":"349e10fd-3156-4aee-88bc-9defb7f64707","resolution":{"observed_at":"2026-08-06T17:47:42.141183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:47:42.148888Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.148888Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:dc9770b30500e822ddd13d977afb82b891f2d28f3ff32ad8f0c32a23020e9f3c","observation_id":"835e50c9-c67b-4656-9988-7c2800815202","resolution":{"observed_at":"2026-08-06T17:47:42.148888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T17:47:42.156308Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.156308Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:51a61c7578c1833496f2596b07f818c7c3ee5aafc12203f6c91bb519a82fe1bb","observation_id":"8ca5c10e-e30f-435e-9a27-aadbf8e43556","resolution":{"observed_at":"2026-08-06T17:47:42.156308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-06T17:47:42.162445Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.162445Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:0fe9213fb2b984c254deff522d3b2a8a45da709e836d1e1eff34ba0be4333415","observation_id":"54ddac35-e20a-46b0-b768-1c0de6e45bf3","resolution":{"observed_at":"2026-08-06T17:47:42.162445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T17:47:42.167491Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.167491Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:60d6e8109693a2bb093516de7059466299e29bcd37c37a70a8f0e29db12fef9b","observation_id":"0d483399-029a-4025-af25-f559a1e4b9e7","resolution":{"observed_at":"2026-08-06T17:47:42.167491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:47:42.177873Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.177873Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:3fd0fa5ae714b4ce109cb1515f98b9c6f2a13560f2a7881f5fda73d2538aee80","observation_id":"ec8ccf61-5e2a-4ef2-90d2-3f8abc6388b1","resolution":{"observed_at":"2026-08-06T17:47:42.177873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02884","last_updated":"2024-11-26T06:29:12Z","snapshot_observed_at":"2026-08-07T22:11:56.746054Z","submitted_at":"2024-06-05T03:05:52Z","title":"PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02884","snapshot_observed_at":"2026-08-06T17:47:42.183539Z","title":"Posterllava: Constructing a uni- fied multi-modal layout generator with llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.183539Z"},"links":{"cited_paper":"/paper/2406.02884","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:c10133d8d4428b2f6c68fc1fa453ce22d0befc13c5dce94927c0c2ca86b909cb","observation_id":"65f3be12-cf3c-416b-8424-352dd227a140","resolution":{"observed_at":"2026-08-06T17:47:42.183539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.892748Z","title":"Glyphcontrol: Glyph conditional control for visual text generation","venue":null,"work_id":"23de48ed-3ac3-4162-b324-6eaad6855346","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.191543Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:90858d40f4ecb0d7f98563c8c527619a7f4cc0d8dbff3cea1f774c5c4a91fb69","observation_id":"6856253a-2d9e-4c4b-937c-68b9fb68e6d7","resolution":{"observed_at":"2026-08-06T17:47:42.897579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T17:47:42.202248Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.202248Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:6249d67dd9bb295846e1e2cf6ef8cbe0cbfec7c06d3f56e4b4ec850fb7cafef7","observation_id":"2d5e9827-7b29-4420-b91b-f365fe9ac499","resolution":{"observed_at":"2026-08-06T17:47:42.202248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11502","last_updated":"2024-07-21T08:22:18Z","snapshot_observed_at":"2026-08-07T22:11:53.570451Z","submitted_at":"2024-07-16T08:40:21Z","title":"How Control Information Influences Multilingual Text Image Generation and Editing?","version":2},"cited_work":{"arxiv_id":"2407.11502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.11502","snapshot_observed_at":"2026-08-06T17:47:42.387728Z","title":"How Control Information Influences Multilingual Text Image Generation and Editing?","venue":"cs.CV","work_id":"8dc31572-38c6-4178-a2f9-3e317aa6045f","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.207523Z"},"links":{"cited_paper":"/paper/2407.11502","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d55fb513f360c99efefc748ccac03cc3a64a0d0ab73c2f951cc1007629a6eaa5","observation_id":"05cf33f3-0a00-4dbf-a5be-a25db379dd1b","resolution":{"observed_at":"2026-08-06T17:47:42.393461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.213468Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.213468Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:a5848181f336a6a30e423746e2ee846e51f3891ce32c1060382454509abf1d36","observation_id":"0614e2be-3e94-4567-92b2-7e43003ffb8f","resolution":{"observed_at":"2026-08-06T17:47:42.213468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:42.861330Z","title":"CDistNet: Perceiving multi- domain character distance for robust text recognition","venue":null,"work_id":"c4873ead-ee69-4ddd-abb0-a181c167e1a6","year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.219019Z"},"links":{"citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:925b611c17793cfb1aeb899e407395be5ed9b139ac528f93ccf09b9a205906e1","observation_id":"e1c6f685-7263-48b0-81f1-238cb89da82d","resolution":{"observed_at":"2026-08-06T17:47:42.866265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T17:47:42.225102Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.225102Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:e0578331aa4915c2ed4d0e0554b772c44a8d93461b4659f740117ad2cf023d3b","observation_id":"b6b1bb84-aaa4-4ff0-8c76-80cfd7e16f45","resolution":{"observed_at":"2026-08-06T17:47:42.225102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00303","last_updated":"2022-07-13T05:09:51Z","snapshot_observed_at":"2026-08-07T22:13:57.732347Z","submitted_at":"2022-04-30T16:42:13Z","title":"Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs","version":3},"cited_work":{"arxiv_id":"2205.00303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.00303","snapshot_observed_at":"2026-08-06T17:47:42.322406Z","title":"Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs","venue":"cs.CV","work_id":"0e52baf7-cbd6-405b-8721-497c3d55d06f","year":2022},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.235544Z"},"links":{"cited_paper":"/paper/2205.00303","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:38a493a6b69fa96e12fbc5aaf6ebfea1167c0702722e97953510ab4641103154","observation_id":"e5371ea6-71c1-47f7-8e12-ec26bd8019f9","resolution":{"observed_at":"2026-08-06T17:47:42.329176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T17:47:42.242811Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:42.242811Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.09910"},"observation_digest":"sha256:d1befb8b2e93f49ef2ff114b7b5732773b9d8de330360f9b3775cbd1255422d9","observation_id":"887eddcf-7498-4b2e-932c-14868959cb8b","resolution":{"observed_at":"2026-08-06T17:47:42.242811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09910","last_updated":"2025-07-14T04:31:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:24:33.519954Z","submitted_at":"2025-07-14T04:31:15Z","title":"IGD: Instructional Graphic Design with Multimodal Layer Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2507.09910."}