{"as_of":"2026-08-19T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddf2414da06e162a49ffa8e6a4f25feaa904542c57e6e9fa7a026629dece2e51","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:14:44.351306Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18729/citation-record","integrity":"/paper/2504.18729/integrity","json":"/paper/2504.18729/citation-record.json","paper":"/paper/2504.18729"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.165604Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.165604Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:4fc6298376b9f6967bc76f7ae0be735f8c113cdb10bbc1d29f2268ad212769c8","observation_id":"6c10e4a6-3015-4273-b8af-2a9eb3703d25","resolution":{"observed_at":"2026-08-16T10:14:44.165604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.145495Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"74478fec-e9a5-4281-9827-0709292a6cff","year":2022},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.171536Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:c525eba22d48fbe64c7d6a7a18a907123b1197013193a9fbe7acddc99ae263f0","observation_id":"bf0ed2a2-7800-4445-a89c-36d3e5dbb852","resolution":{"observed_at":"2026-08-16T10:14:45.150858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-16T10:14:44.176235Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.176235Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:78f10178de58f63f910f47fc0464a6352e1a7413873141d013362f5dbeaeaf83","observation_id":"3a6248ce-e3b0-4f15-ab0a-511d540e30c8","resolution":{"observed_at":"2026-08-16T10:14:44.176235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.182323Z","title":"pix2code: Generating code from a graphical user interface screenshot","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.182323Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:d29e876e672204151a8ecf3cae6669f5c3e34b2b142c505b8f94656f9897b908","observation_id":"284940fb-f872-4af9-883a-ea5f717437f6","resolution":{"observed_at":"2026-08-16T10:14:44.182323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-023-46500-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.418713Z","title":"A novel code generator for graphical user interfaces","venue":null,"work_id":"b3c008ba-1fcc-4e50-90b2-18a5b42a9fd5","year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.186928Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:6b1e3a683b9e51aa95fdd29dbaaaf6d4fa587d82e5bad6539609b1e423224bc6","observation_id":"a2abcc97-a5f6-4b64-be99-cf419c2bd567","resolution":{"observed_at":"2026-08-16T10:14:44.423213Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.191472Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.191472Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:a400e6210f1681014349346e85b54a082c0b21ede48ef49193a3346eb6408dbc","observation_id":"a77e8105-9c34-4001-8998-0c24c8e25441","resolution":{"observed_at":"2026-08-16T10:14:44.191472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T10:14:44.196089Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.196089Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:bbf11367217d46286a6fdcc4130b5af003a621c2310720cc221b92144c097dac","observation_id":"578ef4c6-12d5-4509-9851-d200f20425c4","resolution":{"observed_at":"2026-08-16T10:14:44.196089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06369","last_updated":"2025-02-22T05:15:18Z","snapshot_observed_at":"2026-08-16T14:02:21.553230Z","submitted_at":"2024-04-09T15:05:48Z","title":"WebCode2M: A Real-World Dataset for Code Generation from Webpage Designs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06369","snapshot_observed_at":"2026-08-16T10:14:44.201023Z","title":"Vision2ui: A real-world dataset with layout for code generation from ui designs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.201023Z"},"links":{"cited_paper":"/paper/2404.06369","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:bbc35245d96ce1cb2b367e8120e5fa0c3cabe2387e37ec4b1cf19a1093d2e7ff","observation_id":"75951254-6c84-495f-a74c-f6717bf30922","resolution":{"observed_at":"2026-08-16T10:14:44.201023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.129789Z","title":"UIC opilot: Automating UI synthesis via hierarchical code generation from webpage designs","venue":null,"work_id":"a7ce82c0-2e45-4542-ba03-81b5a93dc242","year":2025},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.206209Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:39941041862b48eca39e51ec1e19ae9ab2c009893a4670e9b4497c45bd9e0e43","observation_id":"e0be1c32-e972-423d-9585-68e3daa918b0","resolution":{"observed_at":"2026-08-16T10:14:45.135389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.894","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.392832Z","title":"Images in language space: Exploring the suitability of large language models for vision & language tasks","venue":null,"work_id":"7f01e891-8c8d-4784-b5b4-91321147dd32","year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.210992Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:61249b0504a2850d73d7d106be55efd33f39b2415d79ca0a4794b503d347cd83","observation_id":"fbd1a92a-1601-4f12-a84e-f895ce871e49","resolution":{"observed_at":"2026-08-16T10:14:44.399528Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07196","last_updated":"2024-02-21T16:55:00Z","snapshot_observed_at":"2026-08-16T15:24:33.556364Z","submitted_at":"2023-06-12T15:52:02Z","title":"Retrieval-Enhanced Contrastive Vision-Text Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07196","snapshot_observed_at":"2026-08-16T10:14:44.215917Z","title":"Retrieval-enhanced contrastive vision-text models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.215917Z"},"links":{"cited_paper":"/paper/2306.07196","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:28bcbb33d24879c32bc2c9c965fb25103be58b7f97e3902279a9251bb0429100","observation_id":"51a5f1e4-0e9a-4005-83dd-ad509e93ccec","resolution":{"observed_at":"2026-08-16T10:14:44.215917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.114779Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"f424365a-c60c-4c8d-8a7a-635c5017b4ac","year":2021},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.223031Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:54c9fcfc5fba73a065cc5035533fad99fbf6d2c8d0e4829c0daed390524f414f","observation_id":"585981be-5b8a-4911-81c8-7a3e5c569937","resolution":{"observed_at":"2026-08-16T10:14:45.119852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.227306Z","title":"Graph4gui: Graph neural networks for representing graphical user interfaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.227306Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:2404aa70ce4f396808589bb095e5890720cd757b97a94b53982d1dc8b6841410","observation_id":"a2c30c00-1854-4e7e-8a63-73bf7c939379","resolution":{"observed_at":"2026-08-16T10:14:44.227306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.231678Z","title":"Kipf and Max Welling","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.231678Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:f0d47b5ea4b2e0766a8e59fff7d53fcb9e0cb797c64fed1e5f9d7aa332737132","observation_id":"5cf0daf7-9ef0-4294-8ec8-b0450d69baee","resolution":{"observed_at":"2026-08-16T10:14:44.231678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.088001Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"d958ac5a-35f6-43fc-ab7c-0853421c1499","year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.236016Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:03837c6f4b72ef6e135dc737c6aec38d00e1cf2d2c5986504192a841c8a40fc4","observation_id":"21e9f946-5c1a-4f8c-a8d3-0122e1375cc4","resolution":{"observed_at":"2026-08-16T10:14:45.094239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-08-16T14:09:59.275779Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-08-16T10:14:44.240257Z","title":"Unlocking the conversion of web screenshots into html code with the websight dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.240257Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:2baa1b40f232f1e4f50f82b3fe51692687d95308ac4d9adae7c6c63cdfda8963","observation_id":"1e36f79e-5986-4cc6-a43c-9378aff585bd","resolution":{"observed_at":"2026-08-16T10:14:44.240257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.244770Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.244770Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:2862003990a518915f9e44fbdc32a64d0c13106d5971307e7e904e74895d39ae","observation_id":"64f83789-79e8-4cc6-9657-849535647d3b","resolution":{"observed_at":"2026-08-16T10:14:44.244770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.073103Z","title":"BLIP : Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"a2a5e95d-879c-470a-bd65-54f76e5b9812","year":2022},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.248850Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:e05847efe17985f2212dbb41c219296bc29f8b080be00d8d1a9fa9f9b12e7042","observation_id":"6bd53e9d-5b09-4566-83cd-9deb0301eec6","resolution":{"observed_at":"2026-08-16T10:14:45.078200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-16T10:14:44.253051Z","title":"Visualbert: A simple and performant baseline for vision and language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.253051Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:22679e29794c4717fcd6ff1abd660deaf916a9ddcee327cb7adba4633601431b","observation_id":"ed38d0ff-9937-4549-9de8-f9b344dd8fef","resolution":{"observed_at":"2026-08-16T10:14:44.253051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.054380Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"52a0015b-b815-454f-9500-c879ea3688b8","year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.258450Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:1fcdf502ef92749205cfbd1d3b21e79940c2f236b605106a60af91ae912c896d","observation_id":"a83352b3-288b-49a6-9c63-87e4bd5e5ea4","resolution":{"observed_at":"2026-08-16T10:14:45.061462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.037389Z","title":"Hyperbolic graph neural networks","venue":null,"work_id":"ea134d05-b818-491a-854e-d00b45859cb3","year":2019},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.262716Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:5209a15225fb27c17a30b6d27667d4238c71d4556c83eb00cc5d4482d31aaa4d","observation_id":"e5abbcae-a06b-4ef7-aeb8-4b5b89d5ded7","resolution":{"observed_at":"2026-08-16T10:14:45.043487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02213","last_updated":"2024-05-15T16:33:57Z","snapshot_observed_at":"2026-08-16T13:55:34.505414Z","submitted_at":"2024-05-03T16:19:24Z","title":"Automatic Programming: Large Language Models and Beyond","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02213","snapshot_observed_at":"2026-08-16T10:14:44.267161Z","title":"Lyu, Baishakhi Ray, Abhik Roychoudhury, Shin Hwei Tan, and Patanamon Thongtanunam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.267161Z"},"links":{"cited_paper":"/paper/2405.02213","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:e5013d1b4d0732fd7bf083a57189a37e29c01cd57219d10ff693829ab4eb32e1","observation_id":"b11281c0-bb6b-48c1-8a44-d7612c729f49","resolution":{"observed_at":"2026-08-16T10:14:44.267161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:45.021695Z","title":"Reverse engineering mobile application user interfaces with remaui (t)","venue":null,"work_id":"7d84cf53-700b-466a-9ebb-c22653b0faf0","year":2015},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.271984Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:2a7c77888af20f54fd0f3ccea6fff717c1629206bc89c7429b9904dcade1c1d0","observation_id":"20a308f8-18c1-45fd-81a9-535d221c4fc0","resolution":{"observed_at":"2026-08-16T10:14:45.026861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.276491Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.276491Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:64bf9e07fa6d3d067eb93fda544d3b227bad182d28ac1c4a122af00eaeaeac35","observation_id":"cfa438ca-3ed6-4975-a985-6be78cbf8335","resolution":{"observed_at":"2026-08-16T10:14:44.276491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.995629Z","title":"Recipe for a general, powerful, scalable graph transformer","venue":null,"work_id":"65d61c79-d94e-43ba-b814-407562b6d20d","year":2022},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.281052Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:d7918a675cc25e4a5d9271a033d0e21857e5607fb165ddd4080a0bfc406cdcac","observation_id":"5f72fb9b-dd0d-4600-87a8-f209512952cc","resolution":{"observed_at":"2026-08-16T10:14:45.001808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13750","last_updated":"2019-05-09T10:15:13Z","snapshot_observed_at":"2026-08-14T16:35:01.128621Z","submitted_at":"2019-05-09T10:15:13Z","title":"Sketch2code: Generating a website from a paper mockup","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13750","snapshot_observed_at":"2026-08-16T10:14:44.285487Z","title":"Sketch2code: Generating a website from a paper mockup, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.285487Z"},"links":{"cited_paper":"/paper/1905.13750","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:915b0ca3de0d9258380633ed7b002d14b5179780ebf7b9b67c39e9601cb0ae5c","observation_id":"a28a1d5d-8fae-49e8-9d3d-580adfa00125","resolution":{"observed_at":"2026-08-16T10:14:44.285487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.290124Z","title":"Gated graph recurrent neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.290124Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:9f3b6938be24c5fdbcb575ca996088030c4e477b83ec09dde8049ed620609905","observation_id":"f4ef5931-b7ba-48cb-b2fd-44d64c4686bb","resolution":{"observed_at":"2026-08-16T10:14:44.290124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.979182Z","title":"Sketch2Code , 12 2022","venue":null,"work_id":"a43277bc-ce12-4f28-afb4-2e117cbfe5cd","year":2022},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.295780Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:c01a7b6760f7852fe95ee55ff11e6e411264e69c78e0f1906f02172de7ad4578","observation_id":"4e101777-3c3e-4a7b-ae20-255c808b4b22","resolution":{"observed_at":"2026-08-16T10:14:44.984140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03163","last_updated":"2025-02-09T04:22:26Z","snapshot_observed_at":"2026-08-16T14:12:33.804927Z","submitted_at":"2024-03-05T17:56:27Z","title":"Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03163","snapshot_observed_at":"2026-08-16T10:14:44.300729Z","title":"Design2code: How far are we from automating front-end engineering?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.300729Z"},"links":{"cited_paper":"/paper/2403.03163","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:dddb64014eb2e083ac07e9c5b9d640751d9a7532c61f4c5529e226ca045fb2c3","observation_id":"41a96189-0fc3-4874-8451-008e9ba0f68d","resolution":{"observed_at":"2026-08-16T10:14:44.300729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14637","last_updated":"2023-11-03T06:10:33Z","snapshot_observed_at":"2026-08-17T03:14:20.706652Z","submitted_at":"2023-05-24T02:17:32Z","title":"Learning UI-to-Code Reverse Generator Using Visual Critic Without Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14637","snapshot_observed_at":"2026-08-16T10:14:44.305372Z","title":"Learning ui-to-code reverse generator using visual critic without rendering, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.305372Z"},"links":{"cited_paper":"/paper/2305.14637","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:d38d04107b20b10a981779be8eb4a0379795632fb67600314a8870b0cdf06df6","observation_id":"e80284fd-757e-4fd6-81f5-6d9eee79a18e","resolution":{"observed_at":"2026-08-16T10:14:44.305372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14734","last_updated":"2025-01-26T10:48:44Z","snapshot_observed_at":"2026-08-16T14:07:45.421990Z","submitted_at":"2024-03-21T08:54:56Z","title":"A Survey of Neural Code Intelligence: Paradigms, Advances and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14734","snapshot_observed_at":"2026-08-16T10:14:44.310078Z","title":"A survey of neural code intelligence: Paradigms, advances and beyond, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.310078Z"},"links":{"cited_paper":"/paper/2403.14734","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:3a5864b099ecff9a2014ca732a7e067e382d24a84a33b2606d4690b5a13d45c1","observation_id":"d641b48d-25a6-4b6e-b3d2-e160e6dd1734","resolution":{"observed_at":"2026-08-16T10:14:44.310078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.314425Z","title":"LXMERT : Learning cross-modality encoder representations from transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.314425Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:6651b20aa97b42506f9ca2c9318dc828fd09bc47915cae199ef1ae7ba1688aba","observation_id":"cf616729-48e6-4a5f-9358-6a0668c7c85b","resolution":{"observed_at":"2026-08-16T10:14:44.314425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-16T10:14:44.318632Z","title":"Cogvlm: Visual expert for pretrained language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.318632Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:3754e2f346dd4dbc4069ccef0c951f18b571632999859bdb2a3302a670f3da27","observation_id":"d7aa72a4-925b-45c2-959f-bcbe3807aaa1","resolution":{"observed_at":"2026-08-16T10:14:44.318632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.322954Z","title":"Webui: A dataset for enhancing visual ui understanding with web semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.322954Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:36a45dddc084ae31b8e0c36ad5288f2975a082ddd2d44666eccf12ab2bd4dd28","observation_id":"a19cceea-64ad-4e23-be1c-956f26847ed0","resolution":{"observed_at":"2026-08-16T10:14:44.322954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20098","last_updated":"2024-11-17T16:11:00Z","snapshot_observed_at":"2026-08-18T04:07:03.724013Z","submitted_at":"2024-06-28T17:59:46Z","title":"Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20098","snapshot_observed_at":"2026-08-16T10:14:44.327454Z","title":"Xing, Xiaodan Liang, and Zhiqiang Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.327454Z"},"links":{"cited_paper":"/paper/2406.20098","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:49c6a5e779c4a385c404ef136b67163dda1409295e5d57d11c3af850bf239ca6","observation_id":"9c7f8ee3-2a50-46ff-bb07-38ecfc234592","resolution":{"observed_at":"2026-08-16T10:14:44.327454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09420","last_updated":"2023-05-08T10:25:41Z","snapshot_observed_at":"2026-08-18T13:26:47.703602Z","submitted_at":"2022-12-19T12:55:32Z","title":"Large Language Models Meet NL2Code: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09420","snapshot_observed_at":"2026-08-16T10:14:44.332583Z","title":"Large language models meet nl2code: A survey, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.332583Z"},"links":{"cited_paper":"/paper/2212.09420","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:ed97a631d2c2e3ec9b51c47f72a96ebd9c870343f01fbebd4fc929c70e1e9067","observation_id":"591f50e4-2d95-42f0-8e85-0825441a5c98","resolution":{"observed_at":"2026-08-16T10:14:44.332583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11667","last_updated":"2024-09-18T03:04:12Z","snapshot_observed_at":"2026-08-16T13:17:38.406587Z","submitted_at":"2024-09-18T03:04:12Z","title":"Bridging Design and Development with Automated Declarative UI Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11667","snapshot_observed_at":"2026-08-16T10:14:44.337152Z","title":"Bridging design and development with automated declarative ui code generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.337152Z"},"links":{"cited_paper":"/paper/2409.11667","citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:64708cfba0267d5f945025d5efe64403b98af8e68fa50401bd49b6288dee4d38","observation_id":"e26a5285-4caa-41fc-817a-fee449d9c1c1","resolution":{"observed_at":"2026-08-16T10:14:44.337152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.341689Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.341689Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:534a2c8b7db872a911747a1bc4ad78ee859d30452acfa8aea2f3e68123ac4c34","observation_id":"2f906c4d-0cf7-4168-b976-1729fd993667","resolution":{"observed_at":"2026-08-16T10:14:44.341689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.346294Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.346294Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:915bbcad019e6588fc284b15e8c54da556c07a59af781e45192eb111f1a33d3a","observation_id":"28d42d36-7460-4272-a091-2524088ee274","resolution":{"observed_at":"2026-08-16T10:14:44.346294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:44.351306Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:14:44.351306Z"},"links":{"citing_paper":"/paper/2504.18729"},"observation_digest":"sha256:a391ac0b5c6fe7ac3ed3ff1bba682b6c192a26ce3d020b331735534a5c19314e","observation_id":"43cd10b9-f47e-4642-956b-72b229833c1e","resolution":{"observed_at":"2026-08-16T10:14:44.351306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18729","last_updated":"2025-04-25T22:48:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:08:35.474085Z","submitted_at":"2025-04-25T22:48:10Z","title":"Multimodal graph representation learning for website generation based on visual sketch"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2504.18729."}