{"as_of":"2026-08-10T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3b888cd945b6e132b283b8ef2853ee9acb05085603f7316b150bc55cc887b54","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:09:57.752216Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:24:06.863653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:53:16.571474Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"cited_work":{"arxiv_id":"2508.20410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20410","snapshot_observed_at":"2026-06-29T08:53:16.571474Z","title":null,"venue":null,"work_id":"6eb4f8c3-5692-4c39-9020-5110a6cfb70c","year":2025},"citing_paper":{"arxiv_id":"2605.30000","last_updated":"2026-05-31T12:00:02Z","snapshot_observed_at":"2026-08-02T18:55:27.003152Z","submitted_at":"2026-05-28T14:30:33Z","title":"Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T07:24:06.863653Z"},"links":{"cited_paper":"/paper/2508.20410","citing_paper":"/paper/2605.30000"},"observation_digest":"sha256:1011552f6f142ab8653e5a8cb0c89a32a9ed98ece48b9abfc052f818a06d8ee9","observation_id":"7f67039e-6fbf-438a-ab82-ba6c45131e25","resolution":{"observed_at":"2026-06-29T08:53:16.572734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20410/citation-record","integrity":"/paper/2508.20410/integrity","json":"/paper/2508.20410/citation-record.json","paper":"/paper/2508.20410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.214481Z","title":null,"venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.214481Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:9fd69d2c5dd5c5d9796992eff82eb5fb13ef5369af72bdff4ae1920093553dff","observation_id":"65aab1c0-7db7-41aa-abff-39dde2965523","resolution":{"observed_at":"2026-08-05T15:09:57.214481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:00.129069Z","title":null,"venue":null,"work_id":"4b640668-dddd-41a4-b874-e1233525006f","year":1996},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.228327Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:c0f59ca3183708742c4c52785f720a308aff665e46dae35c918a25d71c299c5e","observation_id":"82ed7fb3-3e55-4177-940b-3c57279370b7","resolution":{"observed_at":"2026-08-05T15:10:00.136771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.249680Z","title":"Bradley and Milton E","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.249680Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:1de2aa987c9312a64a7cda6c3dc9e2303ea3ec445b4de374787312c587d8a960","observation_id":"b0ccbc2a-037a-4b79-b510-5d9d5366ec60","resolution":{"observed_at":"2026-08-05T15:09:57.249680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T15:09:57.259941Z","title":"Evaluating large language models trained on code, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.259941Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:d564584d6922163c674cb1d02ab7b4dfe66038cc72d57301b1dcc55c6b0aa570","observation_id":"1631b0f7-7cd7-4890-bcdb-45ed640fd8b3","resolution":{"observed_at":"2026-08-05T15:09:57.259941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-05T15:09:57.271533Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.271533Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:3dd08dcde1849b473d940098a4d5ecaaa3cb8d5144ca19c1a2471835651da18c","observation_id":"815ef57a-394b-4e6a-a9cb-8930cc89e648","resolution":{"observed_at":"2026-08-05T15:09:57.271533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:00.095054Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"8c7b55b7-d4c8-43a6-b682-ac664947608f","year":2017},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.282278Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:556d2ccac6f4521d9075f4a996d46aa24d75b3cefafc8b4d766aca52c109366f","observation_id":"afdfb030-efd2-4bea-9827-9445d805f67d","resolution":{"observed_at":"2026-08-05T15:10:00.103926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T15:09:57.290745Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.290745Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:a3caee58afd553c6760a1a28c59d3d8f2392fee887c6eb725fb5e65943c51650","observation_id":"5164c8bb-d624-499e-90b9-59288ff6734e","resolution":{"observed_at":"2026-08-05T15:09:57.290745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ijhcs.2018.11.006","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.232858Z","title":"Webthetics: Quantifying webpage aesthetics with deep learning","venue":null,"work_id":"273c60b5-64fb-4b20-b85b-671c7c4d9f4b","year":2019},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.299263Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:da166c1bfd93796a5d4d12c136406e355efb88332ec21e7f52e80b650f58657d","observation_id":"70645d0a-507c-4d93-827f-0c62fb73eff2","resolution":{"observed_at":"2026-08-05T15:09:58.246249Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T15:09:57.307467Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.307467Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:9b57f35d2a4923dcba01e9edde00935b2c450c52e3104ea6b2e5d056c71a4838","observation_id":"8052a84d-fe4f-492b-b80a-39e2a558cc6b","resolution":{"observed_at":"2026-08-05T15:09:57.307467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.28945/4016","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.185337Z","title":"How content volume on landing pages influences consumer behavior: Empirical evidence","venue":null,"work_id":"932fd3d9-9383-4b65-9c4b-5a88b98841b4","year":2018},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.325846Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:95fa5463ca31504d31d7cbf6b9fc4d78ec6e91af7e619e1cf9908adf6eada4ab","observation_id":"7e0ab56e-42f0-47ec-b5e5-71a656ad01dc","resolution":{"observed_at":"2026-08-05T15:09:58.198420Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5024.36503","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.989034Z","title":null,"venue":null,"work_id":"3c369483-4a09-4b9a-b456-7a79eb9f0659","year":2001},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.331145Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:785f07b192cd298195c189897465b273186933e15819e86f1caa3740ae6afefa","observation_id":"1951a0b7-5bd7-4954-8286-58e544bf0fa6","resolution":{"observed_at":"2026-08-05T15:09:59.005222Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:00.068227Z","title":"WebCode2M : A real-world dataset for code generation from webpage designs","venue":null,"work_id":"c63c5817-b01c-4ee3-84c4-e9b505e23973","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.344168Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:81ab104d5faa4c453b9dda8d4660818e9a6db0800024a89e016f0aab07c185cb","observation_id":"bef0b77a-d46b-4d4b-9eea-904ec3679ed4","resolution":{"observed_at":"2026-08-05T15:10:00.076131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T15:09:57.353378Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.353378Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:6981dff6032e633ea30a38c5fda7931ce02406da09d74d504180b787646e1746","observation_id":"d5b66df0-df1a-4725-8add-002146646b19","resolution":{"observed_at":"2026-08-05T15:09:57.353378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:00.024886Z","title":"TrueSkill : A Bayesian skill rating system","venue":null,"work_id":"ea49ab90-0be9-4413-89d9-8c7c6f670e1b","year":2006},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.362611Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:e539924ca73b5268480c08303782eaf34162cfc32d800f87cc2029c5d9556596","observation_id":"10c698a1-371a-4203-831b-a0d9b6bb1e55","resolution":{"observed_at":"2026-08-05T15:10:00.037332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.369473Z","title":"CLIPScore : A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.369473Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:d9bad8513202d41dca274c97f986c54135a0dab34b59979dc6b7ea09ba15a34d","observation_id":"805bf1fd-3454-406d-82a7-831e5ee645b0","resolution":{"observed_at":"2026-08-05T15:09:57.369473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08500","last_updated":"2018-01-12T14:05:44Z","snapshot_observed_at":"2026-07-06T05:48:30.254634Z","submitted_at":"2017-06-26T17:45:23Z","title":"GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08500","snapshot_observed_at":"2026-08-05T15:09:57.384528Z","title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.384528Z"},"links":{"cited_paper":"/paper/1706.08500","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:4619b60cd85bad68f50803d6979633e988d40b49724be359c064eddd80536314","observation_id":"d096ce4d-9172-4431-ad5a-b9ce72a23dc5","resolution":{"observed_at":"2026-08-05T15:09:57.384528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1108/intr-09-2016-0271","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.116960Z","title":"Jankowski, J","venue":null,"work_id":"e6906478-5c9a-4e85-8315-36bf78f3ae67","year":2019},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.399939Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:caff78bde01f074ba3d2aa3a8e390399e0a1d4fe4b3efc5a7084c5d86d055d86","observation_id":"b33c70c1-dab6-4d35-ad5d-cc14f7848e0a","resolution":{"observed_at":"2026-08-05T15:09:58.131424Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.990132Z","title":"Jayasumana, X","venue":null,"work_id":"920ff180-68a8-406f-8d8a-957c58272220","year":2024},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.418581Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:531a90b02bf291487bd8b308bf5f945adec595a99fec786c5b6abff35aac581e","observation_id":"1af8fce2-5fe6-41c9-8579-99bde460859d","resolution":{"observed_at":"2026-08-05T15:10:00.007654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.970353Z","title":"Kirstain, A","venue":null,"work_id":"1bd1a17d-e46a-4399-a88b-1ea7cc17663b","year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.428490Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:27a5e3cc3a610d5ceb80ac3f89ef9922393608171799cd87ce6e7bcdd5b65b2a","observation_id":"d6959b45-c4ac-4162-91f4-e7a3ecb6b2bf","resolution":{"observed_at":"2026-08-05T15:09:59.976421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ijhcs.2003.09.002","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.081654Z","title":"Assessing dimensions of perceived visual aesthetics of web sites","venue":null,"work_id":"a266b7db-df30-4106-95e6-43cd42f20057","year":2004},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.435107Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:f31f990374790adf7602d2681be0f847ac3dc0b7c3f7721f51156bacea051740","observation_id":"11f51ac6-fab9-401d-9885-932ddb207ef5","resolution":{"observed_at":"2026-08-05T15:09:58.093488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04287","last_updated":"2023-11-07T19:00:56Z","snapshot_observed_at":"2026-07-06T16:44:27.404644Z","submitted_at":"2023-11-07T19:00:56Z","title":"Holistic Evaluation of Text-To-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04287","snapshot_observed_at":"2026-08-05T15:09:57.445683Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.445683Z"},"links":{"cited_paper":"/paper/2311.04287","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:9601ccf80c557a5b142370f8f729fbe77d48ff4b1320ad372e0421a7d05440ae","observation_id":"4b46df08-7fed-4de0-8419-9a51b9f944c7","resolution":{"observed_at":"2026-08-05T15:09:57.445683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.454500Z","title":"Lu, Zhe Lin, Hailin Jin, Jianchao Yang, and James Z","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.454500Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:18a21a0571c0c5ca523a9a15e80b7e5640c99aad612e355789e10d8d900e8bef","observation_id":"d375a1df-5c6f-4bfc-b978-cfe80cc22b82","resolution":{"observed_at":"2026-08-05T15:09:57.454500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.937770Z","title":"WebGen-Bench : Evaluating LLMs on generating interactive and functional websites from scratch, 2025","venue":null,"work_id":"ede62d39-7032-495a-be09-a92fffd37568","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.473086Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:a651db7b640fe2ffe353359c1b95e6e77b72079eace1bfcc4ed44033c3b64315","observation_id":"cf20d954-4553-47c3-be97-a12dac46b1e1","resolution":{"observed_at":"2026-08-05T15:09:59.956095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.571240Z","title":"FinanceQA : A benchmark for evaluating financial analysis capabilities of large language models, 2025","venue":null,"work_id":"0c07fb32-50a2-41bf-a328-e3af1a92619e","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.483190Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:5e0c428b6aa22a10ffb20717b7237b00a0772e01fba2d0148b8849ee71c78e32","observation_id":"ef14ae84-7beb-4282-ba38-330ec87c57ff","resolution":{"observed_at":"2026-08-05T15:09:59.581827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ijhcs.2010.05.006","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:58.040135Z","title":"Moshagen and M","venue":null,"work_id":"1640948b-1427-4a32-8aca-bb2a6f23863d","year":2010},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.493486Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:da217f84395fc83e03e2ec741159f331f806959e730f469988b5fc21a1b74b84","observation_id":"1aa2f16e-85b4-4548-b80f-cd5788622e03","resolution":{"observed_at":"2026-08-05T15:09:58.052019Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.1240466","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.991493Z","title":null,"venue":null,"work_id":"d806334d-b94e-433e-9f5e-573a2d345fde","year":2013},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.498765Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:a0b74a9023740e378ca581e4cf976d5de83a7c7ea91e2ba96a4a7cef4222f8fb","observation_id":"5a1b4542-2893-402d-9ec4-9bc09ed90dfe","resolution":{"observed_at":"2026-08-05T15:09:58.001466Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0020-0255(02)00404-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.960513Z","title":null,"venue":null,"work_id":"37c8f438-032f-4b37-b609-5f0e7bbed1f8","year":2003},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.508823Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:b761f6b59ebd85fb71763802a892053ddbb69ef9a9ca642904e4ffa2857ec785","observation_id":"a1a29273-0c60-4209-9cab-56af46a901c0","resolution":{"observed_at":"2026-08-05T15:09:57.968857Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.521078Z","title":"Color compatibility from large datasets","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.521078Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:ee0d9083fd12ea8b970a6f93795b91135efbed392a72bf6e310272ca5899fa7f","observation_id":"7a3658b6-317a-43be-be2b-509af2ea6a0a","resolution":{"observed_at":"2026-08-05T15:09:57.521078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10798-011-9189-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.932466Z","title":"Comparative judgement for assessment","venue":null,"work_id":"24cc0cec-9ceb-4227-95b3-76950a1b7b26","year":2012},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.544692Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:97bd4a6aa60b1f88ad70efcd737df2efbe02b450fae0703d0e01368dd897aa0d","observation_id":"3930f5c6-49c0-4fe0-8bda-23a31511888b","resolution":{"observed_at":"2026-08-05T15:09:57.944022Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T15:09:57.551803Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.551803Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:4aea94c89e081c69f1966a586460d8479ce23a9e47c99c1f58cab932b156fe14","observation_id":"4a059356-abf0-4b3f-8645-fb68b21e424d","resolution":{"observed_at":"2026-08-05T15:09:57.551803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.560815Z","title":null,"venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.560815Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:0ae3b605ede13debe3ca37b76ca1c4396466601efa40c689dffd2a29b4f0b4ab","observation_id":"780ed652-e905-4c07-afd6-8047d7423360","resolution":{"observed_at":"2026-08-05T15:09:57.560815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ipm.2007.02.003","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.882391Z","title":"Robins and J","venue":null,"work_id":"98f2ffa0-0ff8-4cb3-96f2-2feeb4de2018","year":2008},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.567210Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:28d6bc8a3bec00095d8341692f55b15d9aaa7c7f75cce0ea0a17432a8675d18c","observation_id":"726bf2ae-d03a-4edd-a1fa-6f783aa1e233","resolution":{"observed_at":"2026-08-05T15:09:57.890926Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.511150Z","title":"Improved techniques for training GANs","venue":null,"work_id":"ba206283-55be-4c59-a711-149451283df5","year":2016},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.578034Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:ce6f9bb7ed9d20be645c9ce70084c280c783617166ff164d4197affd5deeb27f","observation_id":"b6e395de-eed0-4f80-bef3-404ac0bf52c9","resolution":{"observed_at":"2026-08-05T15:09:59.528856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.474388Z","title":"Design2code: Benchmarking multimodal code generation for automated front-end engineering","venue":null,"work_id":"c877c1e3-eff5-427e-a12d-435a980de0cf","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.587542Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:e5f22ca38dbbcfa69d93a0d78949954e271b3cc3d39000c1461d63e8ce4e3825","observation_id":"00f33793-f036-4738-b5a9-500883cbaa17","resolution":{"observed_at":"2026-08-05T15:09:59.486372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-05T15:09:57.600054Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models ( BIG -bench)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.600054Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:28c6c55f62226a40000674e14243843fc69c718ff9bb643f2dec7689e8e63c3d","observation_id":"4bc571d7-7ab6-4154-810c-63e8604c644e","resolution":{"observed_at":"2026-08-05T15:09:57.600054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.616198Z","title":null,"venue":null,"work_id":null,"year":1927},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.616198Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:bb56b0c5cb5f733d7925cedf799ee318e7bfce7c9f64fc93bd5f46a605096d19","observation_id":"7974c531-9c2a-4cf1-8f4c-b6ab4c679265","resolution":{"observed_at":"2026-08-05T15:09:57.616198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.450417Z","title":null,"venue":null,"work_id":"4fd939a2-4bcb-4ae6-9109-94c02d8bd900","year":2018},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.632179Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:cd23da0e3e035f0c5d0158fd2d8fdef8dd6a8944f7bb288ed51f9b7b28c32d7c","observation_id":"59b385df-0352-4354-93e7-a1711bde6633","resolution":{"observed_at":"2026-08-05T15:09:59.458898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.396058Z","title":"Whitehouse and A","venue":null,"work_id":"20c3b2ce-9423-4422-bd4e-2a8f53e85573","year":2012},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.660119Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:e5677cf07800472fe08ccce5631fdc3b83a83f6f36d8081283799c2a4c1a6572","observation_id":"9e84e18a-f110-41fd-9462-3f84d46f5535","resolution":{"observed_at":"2026-08-05T15:09:59.411804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.333168Z","title":"The best AI website builders in 2025","venue":null,"work_id":"3793f984-ed86-4bcb-94fc-bd9dbc2a3c97","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.666058Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:0150f7a9f92735ebc1061ef922619f4666508465a7c18088c42de6b3c82d4500","observation_id":"33c07487-797b-403e-b788-78158d38fad2","resolution":{"observed_at":"2026-08-05T15:09:59.346581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.296091Z","title":null,"venue":null,"work_id":"2d836000-835f-439f-924a-13157b3c05b9","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.676210Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:cdfda12f9da6e1a451360eca5eb560990803a85d6e4d32246c0154e57aa8ce43","observation_id":"4a486708-4a75-4fc0-b6ee-57bd492e3288","resolution":{"observed_at":"2026-08-05T15:09:59.308828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.259517Z","title":null,"venue":null,"work_id":"6d6b6d72-85aa-4799-bb3e-8757bdc700a4","year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.685514Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:e6b256b2ebd5fcb7fee470f98364eff853da9dc5ce9a221f9e7e144d13b10fdf","observation_id":"9787ea74-1043-441b-b32d-316a22f13fbc","resolution":{"observed_at":"2026-08-05T15:09:59.272758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.205916Z","title":"Xing, Xiaodan Liang, and Zhiqiang Shen","venue":null,"work_id":"13181be0-9680-403a-9c33-e022023a3478","year":2024},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.702743Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:bd22fcac87ecc99199e4ab11abb1c2c39e76c429848aed7f3e9727cd971283b9","observation_id":"0a914eb3-5578-49f3-9ac9-f97c4e4a3d6c","resolution":{"observed_at":"2026-08-05T15:09:59.218374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:57.714904Z","title":"HellaSwag : Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics (ACL), pages 4791--4800, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.714904Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:2a23f354dd0ca2359d148ffd0650cbc1cc17e47fa82ab69d1d065893940044f0","observation_id":"11547017-77de-474a-9487-e17c54314058","resolution":{"observed_at":"2026-08-05T15:09:57.714904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T15:09:57.731423Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.731423Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:e36a2596a501c10f9b4767ea228cc3478b23a3f288012e4d457f2311005e84bf","observation_id":"1ddf4ede-2689-4c44-aa82-7a89064a3b35","resolution":{"observed_at":"2026-08-05T15:09:57.731423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-05T15:09:57.740219Z","title":"AGIEval : A human-centric benchmark for evaluating foundation models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.740219Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:10a8762dd3fa6c7b42600cb0eee6cba23590909078aedeb61df5964212a52819","observation_id":"060cab31-313c-40c3-9f4c-a3b8396c4f00","resolution":{"observed_at":"2026-08-05T15:09:57.740219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:09:59.179547Z","title":"Frontendbench: A benchmark for evaluating LLMs on front-end development via automatic evaluation, 2025","venue":null,"work_id":"cc917c27-95dd-4307-8297-2e21882fd675","year":2025},"citing_paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:57.752216Z"},"links":{"citing_paper":"/paper/2508.20410"},"observation_digest":"sha256:9054718a768931d4184f8693b1d3878f10a9333a6e951ee615cff050101dcbbe","observation_id":"cde96057-7635-47b3-8f39-15b200a6330d","resolution":{"observed_at":"2026-08-05T15:09:59.186704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20410","last_updated":"2025-09-03T23:48:21Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T15:09:32.902408Z","submitted_at":"2025-08-28T04:20:00Z","title":"UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":8,"verified_fuzzy":13},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2508.20410."}