{"as_of":"2026-08-24T03:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f444a1ad74e2ca666476cb07cee366f0ae6b58892d6b6739276b363fcbcaedb","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:45:04.573722Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T00:27:09.118340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:28:59.373223Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"cited_work":{"arxiv_id":"2605.17637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17637","snapshot_observed_at":"2026-07-03T21:28:59.373223Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","venue":"cs.AI","work_id":"644edfeb-7f83-4021-8e1f-7f1295f2c1cc","year":2026},"citing_paper":{"arxiv_id":"2606.17861","last_updated":"2026-06-16T12:34:39Z","snapshot_observed_at":"2026-08-15T21:27:16.075975Z","submitted_at":"2026-06-16T12:34:39Z","title":"GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T00:27:09.118340Z"},"links":{"cited_paper":"/paper/2605.17637","citing_paper":"/paper/2606.17861"},"observation_digest":"sha256:ee204cf7f82b64fcec6e23951f155c5114c9394090dc729fe09149e070e0e12a","observation_id":"b1b5b4cc-e465-4034-9d56-be6f81827de3","resolution":{"observed_at":"2026-07-03T21:28:59.374975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17637/citation-record","integrity":"/paper/2605.17637/integrity","json":"/paper/2605.17637/citation-record.json","paper":"/paper/2605.17637"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:d0c28583fa928839ef4e5091704eced315d8133dbe1c9ac9b8f386fcf2e0f7bf","observation_id":"bb3ec9b1-8b6e-44e1-bd02-6ea00a7e1271","resolution":{"observed_at":"2026-05-25T05:45:23.194051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"2b382e01-2a0a-4755-baf9-7d4e97a6c2f9","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:315402927db2773c59652436a0a71c127348ba848ea5156830545abbeeca4e83","observation_id":"66bc43ac-ca4d-4d50-9d83-1afb5920c234","resolution":{"observed_at":"2026-05-25T05:46:40.920786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":"25e7c720-d8fc-4f7f-a840-dac9d1d26e34","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e9e3f18eaf20e89d3127ba5c9fc32d2ca89ea85b7c92b1ba1ffe686d4fbe3c7f","observation_id":"20c070c5-ab3e-4782-a015-c770ecce6dc7","resolution":{"observed_at":"2026-05-25T05:46:40.974772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:5617b471fb95bc4d76cfa41e25dff645b09e1229a1c60baf9bad3bae3f1e2ef5","observation_id":"93d737d9-6e7b-42b8-aaeb-c649ceb56585","resolution":{"observed_at":"2026-05-25T05:45:23.215403Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":"3146fc59-65a8-4f50-a75f-62f49e125ba8","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:24253c375937304f0f4556c4c8bfa396885da9757c5a2c34eac0a550bc96b1e7","observation_id":"82f3704a-95b4-4bb3-b6fc-563bb2ace187","resolution":{"observed_at":"2026-05-25T05:46:40.981949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"aa68f52d-3856-4657-8f5a-f348640c897a","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:4d45da61d220ccf073463379487dfe56e952df84616d051db88a81a5768a07ad","observation_id":"d1cd3566-c8ab-4ff1-ae7c-a9eebdc676f7","resolution":{"observed_at":"2026-05-25T05:46:40.999118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:f071243824a78ae2232b177168a53c8651daadea452524404e3408d3a8eea311","observation_id":"01c54d82-5422-4b4a-a4b7-4723782c41b2","resolution":{"observed_at":"2026-05-25T05:45:23.280332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:1afd32459e073c6a2032f09929451f5703a77897ebf37ebf30979ec475e4efd2","observation_id":"cac1bea3-e127-4f68-b1cb-c97167537ccf","resolution":{"observed_at":"2026-05-25T05:45:23.252587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swt-bench: Testing and validating real-world bug-fixes with code agents.Advances in Neural Information Processing Systems","venue":null,"work_id":"ae2be5b2-b0f9-4a60-902d-5bd16ec5a25a","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e9c586406da7d7603288f0d8280cefe859e1ae06e60d7b28419cb6f4a58d4d13","observation_id":"6759d600-9a4b-4b75-a72c-0d59d10f7796","resolution":{"observed_at":"2026-05-25T05:46:41.003470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Super: Evaluating agents on setting up and executing tasks from research repositories","venue":null,"work_id":"4ad57511-5ff0-421f-8937-514197f057b3","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e5f3a9dec9beddaf69b41b3b0b53a570c2c4bec1ab2dcee003e6c93d2011df42","observation_id":"ff4c9929-13d7-4033-8bdb-a6e59b4f7e95","resolution":{"observed_at":"2026-05-25T05:46:41.023370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:140754a8f4dc137ddf496d87175badde469186ac31d11e4499815350d29d7408","observation_id":"0f874185-03d4-4125-88d8-5d71560a1adb","resolution":{"observed_at":"2026-05-25T05:45:23.262252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-12T16:49:10.970507Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":"2410.07095","doi":"10.48550/arxiv.2410.07095","metadata_source":"pith","pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","venue":"cs.CL","work_id":"a671e43f-ceab-49e7-adc3-473d802a97ca","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:774ab3438bacbe61e8005209ee00d3762ac35fcd2711f1e09c82129d3127f714","observation_id":"00bc18d5-ec31-494c-8b6c-b2308cea62e8","resolution":{"observed_at":"2026-05-25T05:45:23.240288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03733","last_updated":"2025-08-11T07:13:00Z","snapshot_observed_at":"2026-08-18T22:20:36.256311Z","submitted_at":"2025-05-06T17:59:15Z","title":"WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from Scratch","version":2},"cited_work":{"arxiv_id":"2505.03733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.03733","snapshot_observed_at":"2026-07-02T14:27:04.294250Z","title":"Webgen-bench: Evaluating llms on generating interactive and functional websites from scratch","venue":null,"work_id":"dfd2cec2-20c6-4607-8302-866fb73c2f51","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2505.03733","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:733b1c2f85590e5fb2731f47e1ab20858c199303c6d67c8e28787637caeeca7a","observation_id":"1e345fc4-68bd-4168-b85d-95addb9972d9","resolution":{"observed_at":"2026-05-25T05:45:23.245448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02430","last_updated":"2026-07-31T09:18:44Z","snapshot_observed_at":"2026-08-18T00:13:41.376391Z","submitted_at":"2026-01-05T05:23:07Z","title":"WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics","version":3},"cited_work":{"arxiv_id":"2601.02430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.02430","snapshot_observed_at":"2026-08-03T02:11:55.899214Z","title":"Webcoderbench: Benchmarking web application generation with comprehensive and interpretable evaluation metrics","venue":null,"work_id":"dc87b5fb-6062-42ad-b635-36c26573e84e","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2601.02430","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:217e2aa07b4b5a49fd093c470be54370a82566a4c1070818311dd40bb5c245c1","observation_id":"120ccacd-844b-4a61-8fed-aa9981e24ae2","resolution":{"observed_at":"2026-08-03T02:11:55.899214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14509","last_updated":"2026-04-16T14:05:42Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T09:54:26Z","title":"E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task","version":4},"cited_work":{"arxiv_id":"2510.14509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task","venue":"cs.SE","work_id":"a86abe93-c7e1-404d-bba1-58f8008634c3","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2510.14509","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:c0f8a461be222ced1260ffc4850db94b0e32c22dfba37d858d0f0c32e207e877","observation_id":"178136ce-597d-48aa-a7b3-ace34d7dbb07","resolution":{"observed_at":"2026-05-25T05:45:23.226615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design2code: Benchmarking multimodal code generation for automated front-end engineering","venue":null,"work_id":"2f3f0bcf-6e7b-4952-a451-eb863576d664","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:b06bce7fe9dca383c61f61b46e30f39cfbb66ffc43b706cb0999b7c671e4c3b8","observation_id":"7043df32-94a2-422d-8a28-4544c0826dc0","resolution":{"observed_at":"2026-05-25T05:46:40.994478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sketch2code: Evaluating vision-language models for interactive web design prototyping","venue":null,"work_id":"c36f24f2-0963-4cf4-ac2e-99ad60be020d","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:7d938dc2b82efb59885213b8d889aa9679ab58a16196cd84fa4096109393442e","observation_id":"fb70e453-e129-4291-a73b-31468389411d","resolution":{"observed_at":"2026-05-25T05:46:41.013769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05617528-9679-4f11-afdb-1b0004f49d7b","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:75425051640aa30b766931b6deb942f26d3651f5985f9db7f669746dbffe36d4","observation_id":"2000aacb-b4ee-4b82-9a92-27f336d3e55e","resolution":{"observed_at":"2026-05-25T05:46:41.018744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webuibench: A comprehensive benchmark for evaluating multimodal large language models in webui-to-code","venue":null,"work_id":"28edbf22-8897-4671-83fc-18263840261e","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:52fb0203e0b752f41546c667c80deaf2511fbe0933d27555a4964e93bf6f05d2","observation_id":"eea133ea-44f2-41cc-a62a-56de33d79403","resolution":{"observed_at":"2026-05-25T05:46:41.062773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"c3724762-2f8e-4314-a5a9-e91b4ea9711d","year":2023},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:825e940643db0d3d9d97a988c92be4d2275de0ca7116f900410564ea2456e08a","observation_id":"2e1614ef-3474-43c7-9dd4-e4b79ca58b90","resolution":{"observed_at":"2026-05-25T05:46:41.008386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualwebarena: Evaluating multimodal agents on realistic visual web tasks","venue":null,"work_id":"a070c603-ddcb-4a51-8334-6d13dc458b3d","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:785983eff98a68c04ee651af16cad05837c915accfe1aedce4ec4f9d262fc1eb","observation_id":"a0e125fd-d83a-468e-8b7c-a6b50e03db55","resolution":{"observed_at":"2026-05-25T05:46:40.951752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":"313d903f-7038-41cd-8caf-9e930b484de2","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:183b4ee797ba57d25eeaeec38794e57c11b4a3cd0dcfb9df5d6ed42e2716ad68","observation_id":"25e059ab-ac1f-48c2-bc40-fea96f8457d0","resolution":{"observed_at":"2026-05-25T05:46:40.942594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-19T15:02:56.056915Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":"2403.07718","doi":"10.48550/arxiv.2403.07718","metadata_source":"pith","pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","venue":"cs.LG","work_id":"5ac27d9e-4522-46f8-985e-0e4f73130803","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:73ba8f75aa9aeb59a9d0244a50559eb4fa73e6e1c53fc092fc2eff7ab25c0796","observation_id":"6b647064-8f00-419f-b4bf-444155667740","resolution":{"observed_at":"2026-05-25T05:45:23.299443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05467","last_updated":"2025-02-28T16:02:27Z","snapshot_observed_at":"2026-08-19T21:46:54.851846Z","submitted_at":"2024-12-06T23:43:59Z","title":"The BrowserGym Ecosystem for Web Agent Research","version":4},"cited_work":{"arxiv_id":"2412.05467","doi":"10.48550/arxiv.2412.05467","metadata_source":"pith","pith_arxiv_id":"2412.05467","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xu, Siva Reddy, Quentin Cappart, Graham Neubig, Ruslan Salakhutdinov, Nicolas Chapados, and Alexandre Lacoste","venue":"cs.LG","work_id":"f7dd22e4-8dc0-4a62-a313-cb0712e5d7dc","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2412.05467","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e4427d5016f2e84b6bda6f43feb8667ae08d97c16e31c0837ab8dda4039bdf5a","observation_id":"524302da-9021-42df-94f0-3d724800c19f","resolution":{"observed_at":"2026-05-25T05:45:23.200540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-19T11:49:14.266180Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":"2405.14573","doi":"10.48550/arxiv.2405.14573","metadata_source":"pith","pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":"cs.AI","work_id":"c5116d19-d3d3-40fd-9620-f7489812a9ba","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:b149fda958defdda91a77876060f97bac7a9a455ef416c2fb52732b2596aefd9","observation_id":"ae2c32ee-4284-4baf-ac79-2eb7651764d5","resolution":{"observed_at":"2026-05-25T05:45:23.290278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.11532","last_updated":"2019-11-08T14:57:21Z","snapshot_observed_at":"2026-08-14T18:57:26.454752Z","submitted_at":"2018-06-29T16:56:07Z","title":"TextWorld: A Learning Environment for Text-based Games","version":2},"cited_work":{"arxiv_id":"1806.11532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1806.11532","snapshot_observed_at":"2026-07-04T03:49:29.956638Z","title":"Textworld: A learning environment for text-based games","venue":null,"work_id":"6ef73060-1415-4154-a5cd-67e55f6d2363","year":1967},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/1806.11532","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:dbadeb420b82f2ef3cef9b3812fba80c24203be7de341b0102f8328e9599f770","observation_id":"404c3a60-58f3-4012-a6ad-0b78588fb4dd","resolution":{"observed_at":"2026-05-25T05:45:23.285380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hausknecht, Prithviraj Ammanabrolu, Marc-Alexandre Côté, and Xingdi Yuan","venue":null,"work_id":"b3167a87-dced-496f-aa45-2508099f4207","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:03c04050b049cc73cff38034540403812810c808f982fa62e251bcf52e4be583","observation_id":"680c73aa-fa11-458b-a0e1-73a2eedc4eb6","resolution":{"observed_at":"2026-05-25T05:46:41.038910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd1c2e51-0ce9-448b-a33f-0639469d0d7a","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:337d951e1da9d5e9538f04b26855c85237d883c2878ae2d4dae3bed959a4e5e0","observation_id":"00c75b46-8373-428a-a8b8-b7de894f403f","resolution":{"observed_at":"2026-05-25T05:46:40.937685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaina, Julian Togelius, and Si- mon M","venue":null,"work_id":"8a938f9f-378a-4292-944b-7eaec0725d68","year":2019},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:6aac86d18b975506a8a419b512363eba5c21fc9aff3da2c2df972462fdb59f91","observation_id":"fb5321b7-2fe6-4058-b23b-b13ab273184a","resolution":{"observed_at":"2026-05-25T05:46:40.947247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca6640de-9d3c-4472-a25a-745f6186ff78","year":2019},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:ba6def90caeef4b57e36fb06e4f3d239173ddb6d17946979b8ac57d7b6770017","observation_id":"f9a9ce99-9c84-4767-94a8-09baf95b6aef","resolution":{"observed_at":"2026-05-25T05:46:40.956269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06613","last_updated":"2024-07-22T14:32:33Z","snapshot_observed_at":"2026-08-17T18:13:25.300652Z","submitted_at":"2024-06-07T00:28:43Z","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","version":2},"cited_work":{"arxiv_id":"2406.06613","doi":"10.48550/arxiv.2406.06613","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06613","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gamebench: Evaluating strategic reasoning abilities of llm agents","venue":"arXiv (Cornell University)","work_id":"cdb22e0a-9571-4240-9df5-528000181bf8","year":2024},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2406.06613","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:0786f46e6d5fad2194911dc88619f161164e58b1d938aeeb885c9030e40280bc","observation_id":"c77d4480-722c-49e4-a929-3313c6fbfeb0","resolution":{"observed_at":"2026-05-25T05:45:23.209799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Balrog: Benchmarking agentic llm and vlm reasoning on games","venue":null,"work_id":"2a834c04-3b80-4b97-99b2-0de1e213bbd6","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e45787f9f678ca6ff609922988b30946fe41e2a022f29f4cf53aab2173f1e9b1","observation_id":"74e2ad8e-145f-4301-a71f-8b44a6e07e6b","resolution":{"observed_at":"2026-05-25T05:46:40.961593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-16T21:41:22.114368Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"cited_work":{"arxiv_id":"2505.15146","doi":"10.48550/arxiv.2505.15146","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, Ion Stoica, Tajana Rosing, Haojian Jin, and Hao Zhang","venue":"ArXiv.org","work_id":"10ddd4f7-8f21-466f-b975-f64ea89b9b2e","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2505.15146","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:d652a83f6d527be906ccdf4b43beb3ebb630c038495cc703936b7ede78b71e0d","observation_id":"2049d76d-8774-4384-a78f-ba5c6d631ed4","resolution":{"observed_at":"2026-05-25T05:45:23.221897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14128","last_updated":"2025-04-24T02:50:28Z","snapshot_observed_at":"2026-08-22T15:10:33.989010Z","submitted_at":"2025-04-19T01:02:42Z","title":"TALES: Text Adventure Learning Environment Suite","version":4},"cited_work":{"arxiv_id":"2504.14128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14128","snapshot_observed_at":"2026-07-03T18:38:49.421232Z","title":"Tales: Text adventure learning environment suite","venue":null,"work_id":"934e45a8-c530-49fa-b329-0f7dcbf6273e","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2504.14128","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:4afbdf08ffd896811d6cfed892038b2859b228ec20e6b4300204fe87352aed95","observation_id":"cdceeb6f-9673-4b71-9d62-2df4963d2819","resolution":{"observed_at":"2026-05-25T05:45:23.189838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude opus 4.7","venue":null,"work_id":"44a80753-034f-4ff5-8c73-0086a333d7c6","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:24a914d9b31834972b9fedaa62f7bee5ae44b3d3f17160af2a284363c03e44f8","observation_id":"bb01384f-2703-442c-8243-8e8e8ba31a4a","resolution":{"observed_at":"2026-05-25T05:46:40.929478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude opus 4.6","venue":null,"work_id":"5127f445-dd2e-44e5-a9ea-58258d48120c","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:8f10cf3da8e9b0a2d48419f7ad8da5b6f01bdeabd052621577c747db2f7d7bb3","observation_id":"025d0cab-d19d-49b1-b138-a4f8e5d36dab","resolution":{"observed_at":"2026-05-25T05:46:40.933521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude sonnet 4.5","venue":null,"work_id":"5c60c483-f4f4-4e92-85f7-684e22282e44","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:2ec5ec7a8cb0b65a1eb29d75f44f9f806a2d8d0240b1c8944112fde0a2cd5616","observation_id":"11a648bd-16f6-4d64-b1b4-72af84ce9e13","resolution":{"observed_at":"2026-05-25T05:46:40.966765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-5.5","venue":null,"work_id":"87f57007-9bdf-4215-8f3f-664300c0f2b0","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:7fa853e2e775d9b1915e4a97bf6df2d01097381d2530b4f6f541a203350a2356","observation_id":"a5f6d8eb-af32-45ef-b26a-33d91bf8c619","resolution":{"observed_at":"2026-05-25T05:46:40.986113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T19:04:03.613958Z","title":null,"venue":null,"work_id":"85a081d5-595c-47a2-9ab9-548271466ab7","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:90c6102ac62f6905f9681096e2bda9eee2602a802eddc4fc217e7c97cedf57db","observation_id":"ba447b7b-b8f3-43b1-ba3f-7a07e2021c85","resolution":{"observed_at":"2026-05-25T05:46:40.907832Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3.1 pro: A smarter model for your most com- plex tasks","venue":null,"work_id":"bfe47ba1-3a22-4c84-ae5b-478d41e98b80","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:ecc5e14554ef726fee9c6477ef5e6d5fc13e45690620b5aef87d3e23f60e14c2","observation_id":"a7deb0e6-09cd-4cf5-be94-41d768ac141c","resolution":{"observed_at":"2026-05-25T05:46:40.912053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:26.457128Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence","venue":null,"work_id":"b5a5843d-47c0-432e-88d5-c9eaac555a7f","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:13c28227df08fa4ee5ca7d30d8407f078cb9a0bbbf1745b6aa2f0266df70475d","observation_id":"0e759192-9d5a-472e-a189-ed2a32b9093f","resolution":{"observed_at":"2026-05-25T05:46:41.035226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi k2.6: Scaling agentic intelligence","venue":null,"work_id":"0188773f-ec6f-464e-b88f-2a50bd5251e1","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:760f2987abe024070ec2776af10d1d1012e2ef6ebe875b989fb059eea0d256f7","observation_id":"398f1df7-c409-49a8-bf5e-0af58efe0211","resolution":{"observed_at":"2026-05-25T05:46:40.990587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:473fbe92f8f23efda98a7a480e81fb263e957587f58aee8756706f99d5402c67","observation_id":"73dd40d3-9aaa-48df-9be2-f81483dbbe12","resolution":{"observed_at":"2026-05-25T05:45:23.303938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:1eafd21b6f1ea832b7e4b6c806c345b25fdccc8b9712413c46edcc016ef7a1c9","observation_id":"f6f8cd44-53f0-46e5-8d5b-b9c170e480af","resolution":{"observed_at":"2026-05-25T05:45:23.231328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7127cee5-aa18-45dd-8a57-23ce6fa3c0ec","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:435e4bf51628b5fb7e869befd07c67a530f69266b0ead0903e744ce1f4696bbc","observation_id":"6e3806d9-97ca-4bb6-9fd0-792f4de0d4b7","resolution":{"observed_at":"2026-05-25T05:46:40.924888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"articles/2202320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pressing the left arrow moves the player left","venue":null,"work_id":"85c45373-5a50-49cb-9367-2cdfcc133b30","year":2026},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:4d95e824c05bfc05918bd4dd5c7dd7d3e2e81e8088c62ebeeee1ea219ea62544","observation_id":"1e07b6a8-2c6b-4564-97c1-ba37120e10b8","resolution":{"observed_at":"2026-05-25T05:45:23.270452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"edf2159f-e9df-426c-9e75-76bc5e58a9e0","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:e0f20ff5d5ce4d494913444cb235efca4e425c2f22709ba4f74cd2f6d20ae066","observation_id":"d6fa7536-c836-4e91-91fc-29b3fb49d9f4","resolution":{"observed_at":"2026-05-25T05:46:40.903457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3718d1b1-4e2e-430d-a5c6-c034c037d155","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:515edcd96320cc40cd03742a137718f7a6c2b0fd67935264b5b1b7f3382da8d1","observation_id":"af8de94a-3e6c-43c7-bbaf-2f0a5676b83d","resolution":{"observed_at":"2026-05-25T05:46:40.898879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9df6e38e-017d-4b90-8f04-c02a5b19a2e9","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:c970c7571f6c631a01c447b4a44572b8d15fe0d01b73b351183b854feb199aa7","observation_id":"7082f243-89b1-4aec-ace8-0254f9f779fa","resolution":{"observed_at":"2026-05-25T05:46:40.916331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5dcc9f4-a84a-4d42-9ba0-60ab435125fb","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:4c526bce926d0c5098aaeaf9c985149a366a304d3ea23463c2d0e1461da220c3","observation_id":"f53ce553-6ad5-45e3-a2a0-bb9b47126238","resolution":{"observed_at":"2026-05-25T05:46:40.969989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ed63b959-59be-47f5-9553-be23422cbc9b","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:845a893cc04911e580f03cbcc30247948b2dfcfdd4571ba4d04c7262b69e1230","observation_id":"d057d20a-23bb-4218-9bb1-a6780fefdf6e","resolution":{"observed_at":"2026-05-25T05:46:41.055158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Source code may explain a failure, but it cannot by itself prove that a user-visible behavior works","venue":null,"work_id":"1ceda7e7-e012-4f7f-a3e9-3c451eb463cb","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:a94f8434b200896d5ffee648f8b89b4ba59f4a0e4fcbd132b0cb122c39d1b89e","observation_id":"fdeff3da-568d-466e-acc7-5ee0e27703bf","resolution":{"observed_at":"2026-05-25T05:46:41.051949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"93e223a1-b502-4c1b-89f1-4d836039a37d","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:5be1d77b487bd8433455507d23fdae96d8c880c0d1c954e0b5170a13743bc7ab","observation_id":"a4db2747-0130-4b2a-a116-e1f275d419f4","resolution":{"observed_at":"2026-05-25T05:46:41.058675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7612a3a6-0f3c-4f07-ad9f-8802c9cc0802","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:d8753cd1a928c8164506a2470cec320d02a4e610d64f711c6a9f68224830e87f","observation_id":"54c9348f-2493-4fa3-ad54-6e579743031b","resolution":{"observed_at":"2026-05-25T05:46:41.042947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"237fdf2f-4ebf-44bd-a1d5-1bb5ecc97c90","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:fe560837a8545140e81e682c4fded178e511f8b31e0d247f123e0783eb05e943","observation_id":"cbf382a9-063c-472b-a55f-39343e8c2898","resolution":{"observed_at":"2026-05-25T05:46:41.047018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3fc9b03c-5581-4736-ae63-1d1ef2a6cd30","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:cd00bb3bbcc45c9f805bb5751b568edc293b8c3113d1e26044667cbd92966892","observation_id":"ff03b7a4-7b46-4b8b-a6d8-59775f700d56","resolution":{"observed_at":"2026-05-25T05:46:41.027215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E Compute Resources and Trace Statistics All generation and evaluation jobs are executed through API calls on a CPU cluster","venue":null,"work_id":"c8bc17ab-f8a2-431e-972a-35be9b81792a","year":null},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:ba201f359927f256d5471239a5853d6e26738e6dba1e245b12f19a557b744fb9","observation_id":"25f2113a-fe40-408a-b02b-f62759a1d6c6","resolution":{"observed_at":"2026-05-25T05:46:41.031074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T06:16:10.379159Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":13,"verified_exact":17,"verified_fuzzy":24},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2605.17637."}