{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c7fd0ee46777572fd7026854a02b7a231c3a9dd17756beef84789e8a870f64e","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:26.603500Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:41:00.426393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:27:04.297349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-08-03T00:15:57.236404Z","title":"Frontendbench: A benchmark for evaluating llms on front-end development via automatic evaluation.ArXiv, abs/2506.13832, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11103","last_updated":"2026-06-30T22:11:21Z","snapshot_observed_at":"2026-08-05T01:34:15.648644Z","submitted_at":"2026-02-11T18:15:11Z","title":"GameDevBench: Evaluating Agentic Capabilities Through Game Development","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T00:15:57.236404Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2602.11103"},"observation_digest":"sha256:78e605a6fea1aca03c7a13b1aa461903370f0fd9c63f83019d668f0bf63ab0c5","observation_id":"c18a88b6-65fa-4483-adfc-5fa674fc85d3","resolution":{"observed_at":"2026-08-03T00:15:57.236404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"highlight-to-cite","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:541687d57f875043a09848e6cffcc884e905e2f951c390048077fde2e2895bbf","observation_id":"71363743-5b87-42af-bc7c-e07ff116eb50","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":"2506.13832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-02T14:27:04.297349Z","title":"Direct”, “Text-Augmented","venue":null,"work_id":"5ded207e-fd02-4bf3-b29e-337887fd1715","year":2025},"citing_paper":{"arxiv_id":"2604.18394","last_updated":"2026-04-20T15:17:03Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:17:03Z","title":"OpenGame: Open Agentic Coding for Games","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:11:22.845269Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2604.18394"},"observation_digest":"sha256:ce96cf1106caf9f2ee16a6458076840f3f049bf2e3eafbb25606b15b52d9d21c","observation_id":"0db5ee38-68e8-4650-8364-e0b8193d97e9","resolution":{"observed_at":"2026-05-11T12:06:03.779588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":"2506.13832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-02T14:27:04.297349Z","title":"Direct”, “Text-Augmented","venue":null,"work_id":"5ded207e-fd02-4bf3-b29e-337887fd1715","year":2025},"citing_paper":{"arxiv_id":"2604.19750","last_updated":"2026-03-14T05:40:30Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-03-14T05:40:30Z","title":"Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T12:06:50.635891Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2604.19750"},"observation_digest":"sha256:43fd01b36db6412e61872fad27fbdc920e5bd90213d263db9da7b021f6773150","observation_id":"5551a81d-9c35-462b-bda8-dcd614cdd1ff","resolution":{"observed_at":"2026-05-15T12:10:00.014976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":"2506.13832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-02T14:27:04.297349Z","title":"Direct”, “Text-Augmented","venue":null,"work_id":"5ded207e-fd02-4bf3-b29e-337887fd1715","year":2025},"citing_paper":{"arxiv_id":"2605.30000","last_updated":"2026-05-31T12:00:02Z","snapshot_observed_at":"2026-08-02T18:55:27.003152Z","submitted_at":"2026-05-28T14:30:33Z","title":"Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T07:24:06.863653Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2605.30000"},"observation_digest":"sha256:5cd1d19c0b236bb634b30d8d3dbdb3e7cfb42443713447ca84145afcf54457c3","observation_id":"a52155c3-6b6a-49db-856e-a13fa93a26cb","resolution":{"observed_at":"2026-06-29T08:53:16.548004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":"2506.13832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-02T14:27:04.297349Z","title":"Direct”, “Text-Augmented","venue":null,"work_id":"5ded207e-fd02-4bf3-b29e-337887fd1715","year":2025},"citing_paper":{"arxiv_id":"2606.01869","last_updated":"2026-06-08T11:47:41Z","snapshot_observed_at":"2026-08-03T04:05:59.549610Z","submitted_at":"2026-06-01T08:17:49Z","title":"WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:02:27.629118Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2606.01869"},"observation_digest":"sha256:9291752befa8184c2a104339f3f1e161e6b590209a0d7ed8f8283b66099e5657","observation_id":"6d5e393e-9640-433e-b82f-0fce3a287e62","resolution":{"observed_at":"2026-07-01T22:46:19.772571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":"2506.13832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-02T14:27:04.297349Z","title":"Direct”, “Text-Augmented","venue":null,"work_id":"5ded207e-fd02-4bf3-b29e-337887fd1715","year":2025},"citing_paper":{"arxiv_id":"2606.05920","last_updated":"2026-06-04T09:24:30Z","snapshot_observed_at":"2026-08-06T16:42:33.524768Z","submitted_at":"2026-06-04T09:24:30Z","title":"Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T00:26:22.041924Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2606.05920"},"observation_digest":"sha256:025b2b19e036c01f25ed323fa3913e31d3b2c378cd363f6f428c381a259c8b8f","observation_id":"83b9c506-ab94-427d-8033-6c05aaa18cb0","resolution":{"observed_at":"2026-07-02T14:27:04.299382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-08-05T14:41:00.426393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03691","last_updated":"2026-08-04T13:59:12Z","snapshot_observed_at":"2026-08-07T14:32:38.409472Z","submitted_at":"2026-08-04T13:59:12Z","title":"Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:00.426393Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2608.03691"},"observation_digest":"sha256:22f52896ba7e321d7d4430599c33ffa69c57d66c845ab1e97f0bdc20d3b30f84","observation_id":"ee6f492a-af4d-4e67-84f0-eedd510bacac","resolution":{"observed_at":"2026-08-05T14:41:00.426393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13832/citation-record","integrity":"/paper/2506.13832/integrity","json":"/paper/2506.13832/citation-record.json","paper":"/paper/2506.13832"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1546","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:26.681467Z","title":null,"venue":null,"work_id":"33c5fb4f-1d3f-4036-b3e9-9b5af91bb909","year":2019},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:24.908418Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:1275b86195373139e1c435cebbfc2692ef73295b7aeea382373540e0471cbadc","observation_id":"f38cf3b7-8d95-4403-a9e7-a21208e8ad1e","resolution":{"observed_at":"2026-08-07T00:40:26.767614Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:40:24.955984Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:24.955984Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:9902dc6257ec43830ae87a13b3621cf81790d677742d398b9f50080d4cce056d","observation_id":"ebb72d8c-dc26-4950-a9b9-e01f1ba9c800","resolution":{"observed_at":"2026-08-07T00:40:24.955984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:25.023398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.023398Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:3c8c3ec6b72573bccaf337e6615fc2e6c5765179805ad1de05f2afe8b1d24788","observation_id":"6d113b5e-29f4-412a-92c2-f9831bda95f4","resolution":{"observed_at":"2026-08-07T00:40:25.023398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07436","last_updated":"2024-06-11T16:45:17Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:45:17Z","title":"McEval: Massively Multilingual Code Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07436","snapshot_observed_at":"2026-08-07T00:40:25.077707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.077707Z"},"links":{"cited_paper":"/paper/2406.07436","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:f6cd0f1fe89e78d69352e97fe011929a0d871961194c08b70cd2dd55cdddc03e","observation_id":"eb3ce9ea-1ee8-41ad-a4f5-c54d6e0b283e","resolution":{"observed_at":"2026-08-07T00:40:25.077707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:40:25.160413Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.160413Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:7008e6da8ea1ea76a32bc18eaabf6bb18befd6cd38db13602e1422976ed65d7c","observation_id":"9c5e4b73-9850-4cc1-a373-24fd1f44151e","resolution":{"observed_at":"2026-08-07T00:40:25.160413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:40:25.207635Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.207635Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:d84dc08cf77d00a81f599b2c55178aea9b4582031c9fc2c60f3a8433c5f69721","observation_id":"5c25eaa2-48b7-4843-860d-aa1b44dd5769","resolution":{"observed_at":"2026-08-07T00:40:25.207635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T00:40:25.265345Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.265345Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:4bb2fe5af62994ccb44d624a90b70a78087494da7cb3ee7d0d7cee4c99966ccd","observation_id":"cea8bf26-3f69-4b31-a11b-13874dc09bcd","resolution":{"observed_at":"2026-08-07T00:40:25.265345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:25.314779Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.314779Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:e323180a0db0a1433ce5e587ae63736ae89595b8cd8b940da605024baf92d31e","observation_id":"450bbcb9-5346-4fbe-9f4e-89d6a55f07af","resolution":{"observed_at":"2026-08-07T00:40:25.314779Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00752","last_updated":"2025-03-18T19:50:04Z","snapshot_observed_at":"2026-08-04T14:50:34.271833Z","submitted_at":"2024-10-01T14:47:05Z","title":"TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00752","snapshot_observed_at":"2026-08-07T00:40:25.396246Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.396246Z"},"links":{"cited_paper":"/paper/2410.00752","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:7d04085e36767053792d06b2193cfe269b5d7b46544acce0d9e74d78516b5bfe","observation_id":"a611a773-c084-4928-a60e-ded7b64f1ecb","resolution":{"observed_at":"2026-08-07T00:40:25.396246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T00:40:25.438511Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.438511Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:f1db72169c42b7eebbcfa461096dd970436b7a9438f99bbbd47716e075af10ed","observation_id":"ec8b8e56-cad2-41f2-b87b-77e607820ee8","resolution":{"observed_at":"2026-08-07T00:40:25.438511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09029","last_updated":"2024-03-14T01:40:40Z","snapshot_observed_at":"2026-08-07T01:10:55.050491Z","submitted_at":"2024-03-14T01:40:40Z","title":"Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09029","snapshot_observed_at":"2026-08-07T00:40:25.506110Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.506110Z"},"links":{"cited_paper":"/paper/2403.09029","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:5c724b420a62c9a81d3737d322c3fb65e6f5350c3dd50989146bf5d9df34962d","observation_id":"4f003ea3-1196-4f8d-8718-2befa1349008","resolution":{"observed_at":"2026-08-07T00:40:25.506110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00599","last_updated":"2024-03-31T08:10:50Z","snapshot_observed_at":"2026-08-06T04:29:52.164901Z","submitted_at":"2024-03-31T08:10:50Z","title":"EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00599","snapshot_observed_at":"2026-08-07T00:40:25.555966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.555966Z"},"links":{"cited_paper":"/paper/2404.00599","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:84fb624487d0918f6df54fd1634bfb627ddcdd20c4b134c0fb6c57f967242dfe","observation_id":"9deef4d0-2bfa-43ae-b3fb-4e519aa81c4c","resolution":{"observed_at":"2026-08-07T00:40:25.555966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:25.600994Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.600994Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:732e9afbaf65f546545ebe1a028d1c93cb18b4b199d5ee52a501f07d7420b100","observation_id":"c44362ac-b167-4263-9f06-b2c9384a52f5","resolution":{"observed_at":"2026-08-07T00:40:25.600994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:40:25.657818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.657818Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:1798aaf37807768231e3de30ee7fd1309a1123a109d77ea3c96601a5982343e7","observation_id":"1af0d42e-2235-4ec4-97b4-8b75deb804d6","resolution":{"observed_at":"2026-08-07T00:40:25.657818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:27.756512Z","title":null,"venue":null,"work_id":"b0feef14-eeae-4dc0-872f-95d1531d5230","year":2021},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.696810Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:f60849c2c8e0181440453decb2fd47c62524259d6216d04239aa29e4cfda01af","observation_id":"d33f063d-aae9-4600-ae1c-1d6e12f31b2a","resolution":{"observed_at":"2026-08-07T00:40:27.944609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01999","last_updated":"2025-04-09T15:52:59Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T20:04:02Z","title":"CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01999","snapshot_observed_at":"2026-08-07T00:40:25.739300Z","title":"Doan, Nam V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.739300Z"},"links":{"cited_paper":"/paper/2410.01999","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:41d420fe417408e308afd5b4a9a129621e687893f85a721d107d59c49ce30de9","observation_id":"b5ba76ff-83e9-48af-9e76-e5f4482bc5d7","resolution":{"observed_at":"2026-08-07T00:40:25.739300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:27.470683Z","title":null,"venue":null,"work_id":"7157b47a-2076-4603-8d3a-9362b9c863c3","year":2025},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.814622Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:89ba5f6fa3e4ca665dcfda15d83543e7495edbb57632ba3336c8465bc83d52ed","observation_id":"e2a5a90b-6bc2-4134-a3d7-a46da2a880fa","resolution":{"observed_at":"2026-08-07T00:40:27.585274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16694","last_updated":"2024-03-24T15:41:21Z","snapshot_observed_at":"2026-08-03T09:29:36.187988Z","submitted_at":"2024-02-26T16:09:00Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16694","snapshot_observed_at":"2026-08-07T00:40:25.876982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.876982Z"},"links":{"cited_paper":"/paper/2402.16694","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:0ac51cb56e701bad6b56ca60c8a835caf462dd81755b3f118386ecd126be01f3","observation_id":"4947d0e8-ed72-4ae7-b606-ee953078acab","resolution":{"observed_at":"2026-08-07T00:40:25.876982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:25.928465Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.928465Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:91dc32890cd52d30b64860dacfe3882b571c36e408035c1cfff26542a978ad4d","observation_id":"cb2b3f76-d544-44ac-80ac-878b3712f9b1","resolution":{"observed_at":"2026-08-07T00:40:25.928465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08587","last_updated":"2025-02-28T15:16:04Z","snapshot_observed_at":"2026-07-06T18:29:53.755897Z","submitted_at":"2024-06-12T18:47:28Z","title":"CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08587","snapshot_observed_at":"2026-08-07T00:40:26.068585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.068585Z"},"links":{"cited_paper":"/paper/2406.08587","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:97ba89e9399d12d88eb9e6b1bdb05127e981fee2fc276096a19a30031b6051d8","observation_id":"08c92ee6-2ec0-4389-83d7-3708f1d96df3","resolution":{"observed_at":"2026-08-07T00:40:26.068585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:27.262012Z","title":null,"venue":null,"work_id":"1b403530-2685-45eb-b506-6a247af8e79d","year":2023},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.140364Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:e927139fbff66df2faa443bf50c59b4a1cae93ecd01efbcbd046338760705979","observation_id":"0fd56bf7-d9c0-4399-ad76-fcc4772a3d94","resolution":{"observed_at":"2026-08-07T00:40:27.362436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:40:26.194608Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.194608Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:0706b5382399a364a4bafb8d746066a9715e03d1a490a32138696dc67efd7cc3","observation_id":"a1bf8f35-5a93-4ffa-bc67-23a84c5565bf","resolution":{"observed_at":"2026-08-07T00:40:26.194608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02184","last_updated":"2024-10-03T03:58:03Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T03:58:03Z","title":"CodeJudge: Evaluating Code Generation with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02184","snapshot_observed_at":"2026-08-07T00:40:26.249510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.249510Z"},"links":{"cited_paper":"/paper/2410.02184","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:7fbaf68589d52726ceb3fc82d82585985edcbe1273f207b2c538ab4197127ae5","observation_id":"e31c68b0-1d1c-4ae7-9254-938acc54e847","resolution":{"observed_at":"2026-08-07T00:40:26.249510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:27.032538Z","title":null,"venue":null,"work_id":"2f5a054e-53a2-4152-8c8b-b52775d2dfa1","year":null},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.353740Z"},"links":{"citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:111360f3acf0511ddaac4710794d02bb243bb82c07c7d58a3ca9d2365af9939e","observation_id":"4a646339-9277-478c-981d-11078d93e809","resolution":{"observed_at":"2026-08-07T00:40:27.136477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T00:40:26.518623Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.518623Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:2405c8b284a4c5c2485252b0e25222982c95d847573c4c1781f610db0adc7e7c","observation_id":"59c06fc5-b529-415d-996a-b916e6029b66","resolution":{"observed_at":"2026-08-07T00:40:26.518623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20098","last_updated":"2024-11-17T16:11:00Z","snapshot_observed_at":"2026-08-04T02:34:31.877467Z","submitted_at":"2024-06-28T17:59:46Z","title":"Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20098","snapshot_observed_at":"2026-08-07T00:40:26.449031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.449031Z"},"links":{"cited_paper":"/paper/2406.20098","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:ba6a40708cde7dcbd702c0088f61d6f0649c5706c15ea8b9db7f2465ccb2d3b2","observation_id":"6b4fa840-a32e-4322-9dd9-737b774a5a7f","resolution":{"observed_at":"2026-08-07T00:40:26.449031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13204","last_updated":"2024-08-23T16:33:58Z","snapshot_observed_at":"2026-07-06T19:05:14.227812Z","submitted_at":"2024-08-23T16:33:58Z","title":"DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13204","snapshot_observed_at":"2026-08-07T00:40:26.603500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.603500Z"},"links":{"cited_paper":"/paper/2408.13204","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:316f4d08f3de83903286d7ac007faaa29f3d62ed4591d943dd470a1128f4b6ce","observation_id":"bf31d789-8049-4b07-ab27-d25861929a81","resolution":{"observed_at":"2026-08-07T00:40:26.603500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03163","last_updated":"2025-02-09T04:22:26Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T17:56:27Z","title":"Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03163","snapshot_observed_at":"2026-08-07T00:40:26.011848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:26.011848Z"},"links":{"cited_paper":"/paper/2403.03163","citing_paper":"/paper/2506.13832"},"observation_digest":"sha256:b716568256c2486ce49993efab21e01ef02537b470da12183bb5bc1a7f5d9bfd","observation_id":"4886c08f-ad2b-4fd5-9f6d-722a3b402c16","resolution":{"observed_at":"2026-08-07T00:40:26.011848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 8 inbound Pith citation observations for arXiv:2506.13832."}