Pith. sign in

Paper Citation Record · LEDGER

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 8 inbound Pith citation observations for arXiv:2506.13832.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.13832 v2

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:40:26.603500Z

measured 36 of 36 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T14:41:00.426393Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:27:04.297349Z

Reference resolution

28 of 28 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved26
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f38cf3b7-8d95-4403-a9e7-a21208e8ad1e · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 1

Resolution
verified exact
doi, observed 2026-08-07T00:40:26.767614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:40:24.908418Z digest=sha256:1275b86195373139e1c435cebbfc2692ef73295b7aeea382373540e0471cbadc

Observation ebb72d8c-dc26-4950-a9b9-e01f1ba9c800 · outbound

This paper cites Program Synthesis with Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:24.955984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:24.955984Z digest=sha256:9902dc6257ec43830ae87a13b3621cf81790d677742d398b9f50080d4cce056d

Observation 6d113b5e-29f4-412a-92c2-f9831bda95f4 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.023398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.023398Z digest=sha256:3c8c3ec6b72573bccaf337e6615fc2e6c5765179805ad1de05f2afe8b1d24788

Observation eb3ce9ea-1ee8-41ad-a4f5-c54d6e0b283e · outbound

This paper cites McEval: Massively Multilingual Code Evaluation.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation McEval: Massively Multilingual Code Evaluation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.077707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.077707Z digest=sha256:f6cd0f1fe89e78d69352e97fe011929a0d871961194c08b70cd2dd55cdddc03e

Observation 9c5e4b73-9850-4cc1-a373-24fd1f44151e · outbound

This paper cites Evaluating Large Language Models Trained on Code.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Evaluating Large Language Models Trained on Code

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.160413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.160413Z digest=sha256:7008e6da8ea1ea76a32bc18eaabf6bb18befd6cd38db13602e1422976ed65d7c

Observation 5c25eaa2-48b7-4843-860d-aa1b44dd5769 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.207635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.207635Z digest=sha256:d84dc08cf77d00a81f599b2c55178aea9b4582031c9fc2c60f3a8433c5f69721

Observation cea8bf26-3f69-4b31-a11b-13874dc09bcd · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Measuring Coding Challenge Competence With APPS

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.265345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.265345Z digest=sha256:4bb2fe5af62994ccb44d624a90b70a78087494da7cb3ee7d0d7cee4c99966ccd

Observation 450bbcb9-5346-4fbe-9f4e-89d6a55f07af · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 8

Resolution
malformed identifier
no resolver link, observed 2026-08-07T00:40:25.314779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.314779Z digest=sha256:e323180a0db0a1433ce5e587ae63736ae89595b8cd8b940da605024baf92d31e

Observation a611a773-c084-4928-a60e-ded7b64f1ecb · outbound

This paper cites TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.396246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.396246Z digest=sha256:7d04085e36767053792d06b2193cfe269b5d7b46544acce0d9e74d78516b5bfe

Observation ec8b8e56-cad2-41f2-b87b-77e607820ee8 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.438511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.438511Z digest=sha256:f1db72169c42b7eebbcfa461096dd970436b7a9438f99bbbd47716e075af10ed

Observation 4f003ea3-1196-4f8d-8718-2befa1349008 · outbound

This paper cites Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.506110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.506110Z digest=sha256:5c724b420a62c9a81d3737d322c3fb65e6f5350c3dd50989146bf5d9df34962d

Observation 9deef4d0-2bfa-43ae-b3fb-4e519aa81c4c · outbound

This paper cites EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.555966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.555966Z digest=sha256:84fb624487d0918f6df54fd1634bfb627ddcdd20c4b134c0fb6c57f967242dfe

Observation c44362ac-b167-4263-9f06-b2c9384a52f5 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.600994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.600994Z digest=sha256:732e9afbaf65f546545ebe1a028d1c93cb18b4b199d5ee52a501f07d7420b100

Observation 1af0d42e-2235-4ec4-97b4-8b75deb804d6 · outbound

This paper cites DeepSeek-V3 Technical Report.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DeepSeek-V3 Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.657818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.657818Z digest=sha256:1798aaf37807768231e3de30ee7fd1309a1123a109d77ea3c96601a5982343e7

Observation d33f063d-aae9-4600-ae1c-1d6e12f31b2a · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.944609Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:40:25.696810Z digest=sha256:f60849c2c8e0181440453decb2fd47c62524259d6216d04239aa29e4cfda01af

Observation b5ba76ff-83e9-48af-9e76-e5f4482bc5d7 · outbound

This paper cites CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.739300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.739300Z digest=sha256:41d420fe417408e308afd5b4a9a129621e687893f85a721d107d59c49ce30de9

Observation e2a5a90b-6bc2-4134-a3d7-a46da2a880fa · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.585274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:40:25.814622Z digest=sha256:89ba5f6fa3e4ca665dcfda15d83543e7495edbb57632ba3336c8465bc83d52ed

Observation 4947d0e8-ed72-4ae7-b606-ee953078acab · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.876982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.876982Z digest=sha256:0ac51cb56e701bad6b56ca60c8a835caf462dd81755b3f118386ecd126be01f3

Observation cb2b3f76-d544-44ac-80ac-878b3712f9b1 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:25.928465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:25.928465Z digest=sha256:91dc32890cd52d30b64860dacfe3882b571c36e408035c1cfff26542a978ad4d

Observation 08c92ee6-2ec0-4389-83d7-3708f1d96df3 · outbound

This paper cites CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.068585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.068585Z digest=sha256:97ba89e9399d12d88eb9e6b1bdb05127e981fee2fc276096a19a30031b6051d8

Observation 0fd56bf7-d9c0-4399-ad76-fcc4772a3d94 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.362436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:40:26.140364Z digest=sha256:e927139fbff66df2faa443bf50c59b4a1cae93ecd01efbcbd046338760705979

Observation a1bf8f35-5a93-4ffa-bc67-23a84c5565bf · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Gemini: A Family of Highly Capable Multimodal Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.194608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.194608Z digest=sha256:0706b5382399a364a4bafb8d746066a9715e03d1a490a32138696dc67efd7cc3

Observation e31c68b0-1d1c-4ae7-9254-938acc54e847 · outbound

This paper cites CodeJudge: Evaluating Code Generation with Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation CodeJudge: Evaluating Code Generation with Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.249510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.249510Z digest=sha256:7fbaf68589d52726ceb3fc82d82585985edcbe1273f207b2c538ab4197127ae5

Observation 4a646339-9277-478c-981d-11078d93e809 · outbound

This paper cites an unresolved cited work.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:40:27.136477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:40:26.353740Z digest=sha256:111360f3acf0511ddaac4710794d02bb243bb82c07c7d58a3ca9d2365af9939e

Observation 59c06fc5-b529-415d-996a-b916e6029b66 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.518623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.518623Z digest=sha256:2405c8b284a4c5c2485252b0e25222982c95d847573c4c1781f610db0adc7e7c

Observation 6b4fa840-a32e-4322-9dd9-737b774a5a7f · outbound

This paper cites Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.449031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.449031Z digest=sha256:ba6a40708cde7dcbd702c0088f61d6f0649c5706c15ea8b9db7f2465ccb2d3b2

Observation bf31d789-8049-4b07-ab27-d25861929a81 · outbound

This paper cites DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.603500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.603500Z digest=sha256:316f4d08f3de83903286d7ac007faaa29f3d62ed4591d943dd470a1128f4b6ce

Observation 4886c08f-ad2b-4fd5-9f6d-722a3b402c16 · outbound

This paper cites Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering.

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:26.011848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:26.011848Z digest=sha256:b716568256c2486ce49993efab21e01ef02537b470da12183bb5bc1a7f5d9bfd

Pith citing papers

Observation c18a88b6-65fa-4483-adfc-5fa674fc85d3 · inbound

GameDevBench: Evaluating Agentic Capabilities Through Game Development cites this paper.

GameDevBench: Evaluating Agentic Capabilities Through Game Development FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T00:15:57.236404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:15:57.236404Z digest=sha256:78e605a6fea1aca03c7a13b1aa461903370f0fd9c63f83019d668f0bf63ab0c5

Observation 71363743-5b87-42af-bc7c-e07ff116eb50 · inbound

LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks cites this paper.

LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-13T20:08:17.066898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T20:08:17.066898Z digest=sha256:541687d57f875043a09848e6cffcc884e905e2f951c390048077fde2e2895bbf

Observation 0db5ee38-68e8-4650-8364-e0b8193d97e9 · inbound

OpenGame: Open Agentic Coding for Games cites this paper.

OpenGame: Open Agentic Coding for Games FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:06:03.779588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T04:11:22.845269Z digest=sha256:ce96cf1106caf9f2ee16a6458076840f3f049bf2e3eafbb25606b15b52d9d21c

Observation 5551a81d-9c35-462b-bda8-dcd614cdd1ff · inbound

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging cites this paper.

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-15T12:10:00.014976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T12:06:50.635891Z digest=sha256:43fd01b36db6412e61872fad27fbdc920e5bd90213d263db9da7b021f6773150

Observation a52155c3-6b6a-49db-856e-a13fa93a26cb · inbound

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation cites this paper.

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:53:16.548004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T07:24:06.863653Z digest=sha256:5cd1d19c0b236bb634b30d8d3dbdb3e7cfb42443713447ca84145afcf54457c3

Observation 6d5e393e-9640-433e-b82f-0fce3a287e62 · inbound

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis cites this paper.

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 12

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T22:46:19.772571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-28T15:02:27.629118Z digest=sha256:9291752befa8184c2a104339f3f1e161e6b590209a0d7ed8f8283b66099e5657

Observation 83b9c506-ab94-427d-8033-6c05aaa18cb0 · inbound

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement cites this paper.

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-02T14:27:04.299382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-28T00:26:22.041924Z digest=sha256:025b2b19e036c01f25ed323fa3913e31d3b2c378cd363f6f428c381a259c8b8f

Observation ee6f492a-af4d-4e67-84f0-eedd510bacac · inbound

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation cites this paper.

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T14:41:00.426393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:41:00.426393Z digest=sha256:f1117db4929f7046087f962ad8c125251513240605157046aa0266955ca7fb23