Pith. sign in

Paper Citation Record · LEDGER

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

As of 23 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 10 inbound Pith citation observations for arXiv:2506.13832.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.13832 v2

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:40:26.603500Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 10 of 10 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T17:26:08.213374Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:27:04.297349Z

Reference resolution

28 of 28 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved26
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f38cf3b7-8d95-4403-a9e7-a21208e8ad1e · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 1

Resolution
verified exact
doi, observed 2026-08-07T00:40:26.767614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-07T00:40:24.908418Z digest=sha256:ff239965eccc6d93edd96d4de5a6a48abc37403fda1856191dcfb180db2436a6

Observation ebb72d8c-dc26-4950-a9b9-e01f1ba9c800 · outbound

This paper cites Program Synthesis with Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:24.955984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:24.955984Z digest=sha256:c06104ac94a8e8feec113e4344c313a2c6fd89c4e0c825b47102916eaf5803aa

Observation 6d113b5e-29f4-412a-92c2-f9831bda95f4 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.023398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.023398Z digest=sha256:c9a4fd5836249a2b3014619bc6648a3ecbbcf6d73abaad56023e78c216fe05a6

Observation eb3ce9ea-1ee8-41ad-a4f5-c54d6e0b283e · outbound

This paper cites McEval: Massively Multilingual Code Evaluation.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation McEval: Massively Multilingual Code Evaluation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.077707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.077707Z digest=sha256:2fea5cde1073216b62694da119a02e9e4afc97f4f9f866a756b20f87ef9dba00

Observation 9c5e4b73-9850-4cc1-a373-24fd1f44151e · outbound

This paper cites Evaluating Large Language Models Trained on Code.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Evaluating Large Language Models Trained on Code

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.160413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.160413Z digest=sha256:c07a58ae78b44e645e9f8e3780a7640cbb2224aeb1a0ec0c7110bab15b32ec4c

Observation 5c25eaa2-48b7-4843-860d-aa1b44dd5769 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.207635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.207635Z digest=sha256:fb5e58568a7242dd249a57bbaaa328eceb0374418dad80b5ef3f3394bc86a830

Observation cea8bf26-3f69-4b31-a11b-13874dc09bcd · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Measuring Coding Challenge Competence With APPS

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.265345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.265345Z digest=sha256:4fe0aa7c0e4ce096914d1004a3e0ef8661fb79a8433893acdc08be90bee9a428

Observation 450bbcb9-5346-4fbe-9f4e-89d6a55f07af · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 8

Resolution
malformed identifier
no resolver link, observed 2026-08-07T00:40:25.314779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.314779Z digest=sha256:bf2c692c5358ea5b0e7efcf8782e99b73b24178b34f561ab47615a96918e1ce9

Observation a611a773-c084-4928-a60e-ded7b64f1ecb · outbound

This paper cites TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.396246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.396246Z digest=sha256:666e0371545f6e5104c4bb91cb18ae245baec4776ea2545ee7afc9f800de0a1b

Observation ec8b8e56-cad2-41f2-b87b-77e607820ee8 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.438511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.438511Z digest=sha256:2a65eedfafe59a4b00050b19bde202ef8ab66cfecf634901f8fe491fd1888df2

Observation 4f003ea3-1196-4f8d-8718-2befa1349008 · outbound

This paper cites Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.506110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.506110Z digest=sha256:419a1d1742a754b0c0a91ee41bf27f03abd41048dc735f6a8bdcd5ecadcf1acb

Observation 9deef4d0-2bfa-43ae-b3fb-4e519aa81c4c · outbound

This paper cites EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.555966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.555966Z digest=sha256:6b5c56beb6981a5b6338165a11ae1b09cba0a5485e038013471a707779692583

Observation c44362ac-b167-4263-9f06-b2c9384a52f5 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.600994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.600994Z digest=sha256:87d83e8c17a82b0e86026aef35b253faf779b49599cbb2f81f34084573153c0c

Observation 1af0d42e-2235-4ec4-97b4-8b75deb804d6 · outbound

This paper cites DeepSeek-V3 Technical Report.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DeepSeek-V3 Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.657818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.657818Z digest=sha256:f61b4e6cadf5477196ea56304ea0efb860df8b93589e1067cca7e5fd1c8918ec

Observation d33f063d-aae9-4600-ae1c-1d6e12f31b2a · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.944609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-07T00:40:25.696810Z digest=sha256:ea979ce3a7bba26efc8dd610c18d7a6b7c64e4c367c7ed0661dc55ec9c82c7f4

Observation b5ba76ff-83e9-48af-9e76-e5f4482bc5d7 · outbound

This paper cites CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.739300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.739300Z digest=sha256:ec020d864936cc1b700fed5ce25b55a01e2a8c0f890e87fb44893aed3a2894b8

Observation e2a5a90b-6bc2-4134-a3d7-a46da2a880fa · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.585274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-07T00:40:25.814622Z digest=sha256:10a9ad308111c85ee5e5febec8a84e4da0c39846df8a27c33823d60c5892ff60

Observation 4947d0e8-ed72-4ae7-b606-ee953078acab · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.876982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.876982Z digest=sha256:40a8270a7cb00a7d3e75b48cc9cd1f0bbd808dcecba5bda235debeee14c13ee7

Observation cb2b3f76-d544-44ac-80ac-878b3712f9b1 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.928465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.928465Z digest=sha256:08f8a82ddba8497b86ec5d8ce818ae90b85e5fb03e262251aa42746df60a8f75

Observation 08c92ee6-2ec0-4389-83d7-3708f1d96df3 · outbound

This paper cites CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.068585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.068585Z digest=sha256:e6f81fb5651e2770c1bf1c75f07d41f86697f2b54ea5d489685ebc7513a36fd4

Observation 0fd56bf7-d9c0-4399-ad76-fcc4772a3d94 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.362436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-07T00:40:26.140364Z digest=sha256:c16464613d532e7fbdcb837244dd80ff3ceb2b4e4038ab3c66b0cf32364dabff

Observation a1bf8f35-5a93-4ffa-bc67-23a84c5565bf · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Gemini: A Family of Highly Capable Multimodal Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.194608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.194608Z digest=sha256:6709b5b4007fbc9645bbb0a7585975b306bebeda55f242a55ee6547deecc282f

Observation e31c68b0-1d1c-4ae7-9254-938acc54e847 · outbound

This paper cites CodeJudge: Evaluating Code Generation with Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CodeJudge: Evaluating Code Generation with Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.249510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.249510Z digest=sha256:06a72cf349dd853ebd6f168277ee22aac8260d4015c281edc0f23c0934ddf65a

Observation 4a646339-9277-478c-981d-11078d93e809 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.136477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-07T00:40:26.353740Z digest=sha256:bb5616770cce186464f7fca1f3c172841c500c34875b24f0d3f5f46e97b05503

Observation 59c06fc5-b529-415d-996a-b916e6029b66 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.518623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.518623Z digest=sha256:17b534d84ce166a8249b7a9605993305eefb0a09cf8a0696b803bdabe0412a25

Observation 6b4fa840-a32e-4322-9dd9-737b774a5a7f · outbound

This paper cites Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.449031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.449031Z digest=sha256:ad62196c16a6e7abc033dd3788dd2ac620bec1368996c72c328866c3db1153ce

Observation bf31d789-8049-4b07-ab27-d25861929a81 · outbound

This paper cites DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.603500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.603500Z digest=sha256:d3a3b51cc34225c0563d85e9db434f8720f77f14651932519cf6dbb5416e9130

Observation 4886c08f-ad2b-4fd5-9f6d-722a3b402c16 · outbound

This paper cites Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.011848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.011848Z digest=sha256:450ec1787f8e86796c955d5cec3f8b1fa017ae10d0ed8fecd89e427d1ddced12

Pith citing papers

Observation 6f3ab3a2-7879-4800-8818-98df075ace08 · inbound

You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation cites this paper.

You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T17:26:08.213374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T17:26:08.213374Z digest=sha256:22271603e0d4b40169c6495abb5a72ca7f58966c897ef3d0fbde7e9af4aced9b

Observation c18a88b6-65fa-4483-adfc-5fa674fc85d3 · inbound

GameDevBench: Evaluating Agentic Capabilities Through Game Development cites this paper.

GameDevBench: Evaluating Agentic Capabilities Through Game Development FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T00:15:57.236404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:15:57.236404Z digest=sha256:714981e657d0dbd568e20bafb85d7ef85919490aef4b77e3967287a50e38d9a2

Observation 71363743-5b87-42af-bc7c-e07ff116eb50 · inbound

LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks cites this paper.

LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-13T20:08:17.066898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T20:08:17.066898Z digest=sha256:c8c82c68d7d6af5b33f91b691881247db71d70bca0b15fcf0ba016c18b786b55

Observation 0db5ee38-68e8-4650-8364-e0b8193d97e9 · inbound

OpenGame: Open Agentic Coding for Games cites this paper.

OpenGame: Open Agentic Coding for Games FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:06:03.779588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T04:11:22.845269Z digest=sha256:ad7876ca5db0bc8b2286f750a7cda12d865c9810b6bae3f08d7d04900a028e1d

Observation 5551a81d-9c35-462b-bda8-dcd614cdd1ff · inbound

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging cites this paper.

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-15T12:10:00.014976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-15T12:06:50.635891Z digest=sha256:30e9261337825d2c4ffb9cbb2fafa6315c5c727536acec8dfff790d20efd88f0

Observation a52155c3-6b6a-49db-856e-a13fa93a26cb · inbound

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation cites this paper.

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:53:16.548004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-29T07:24:06.863653Z digest=sha256:e70dee88cf93616dbab915e9dbe765ffb8da9292322700338e6b71bd38b80c74

Observation 6d5e393e-9640-433e-b82f-0fce3a287e62 · inbound

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis cites this paper.

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 12

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T22:46:19.772571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T15:02:27.629118Z digest=sha256:3e2f88f293cabb71543df731b008d44d1adac2e4107db7aba39f6f085a3434c4

Observation 83b9c506-ab94-427d-8033-6c05aaa18cb0 · inbound

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement cites this paper.

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-02T14:27:04.299382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-28T00:26:22.041924Z digest=sha256:126c8e71b2d6c61484b8747e5ac2f4d1d14f68d8fcaceb5fa75bac30577ce672

Observation 486503ac-cb80-48c5-997b-d6488756e01f · inbound

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction cites this paper.

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T15:36:02.645495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T15:36:02.645495Z digest=sha256:7ba389c43c4a221618207a0cc5852f6560478e109905a019279ba03a5b8e995a

Observation ee6f492a-af4d-4e67-84f0-eedd510bacac · inbound

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation cites this paper.

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T14:41:00.426393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:41:00.426393Z digest=sha256:219f62c62bfbc7495f1db2ab6d7fec3dea7a580ba253df9ca8d5739dc71486c7