{"as_of":"2026-08-21T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cf04815a1b87205517e32b304efd96610e938867fcceb23deadfb9576968e51","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:37:58.494276Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:47:34.593855Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-16T11:47:34.593855Z","title":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-19T20:16:49.881427Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:47:34.593855Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2504.14655"},"observation_digest":"sha256:80af0926125c5a2ab3e6e2e36edc023e8f5b227da3b997d9bcfc45aef1963aaf","observation_id":"7f08bf2f-867b-428e-a3d1-997c413519e5","resolution":{"observed_at":"2026-08-16T11:47:34.593855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-15T22:03:20.437616Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08253","last_updated":"2025-05-13T06:02:37Z","snapshot_observed_at":"2026-08-18T18:20:39.141632Z","submitted_at":"2025-05-13T06:02:37Z","title":"Evaluating LLM Metrics Through Real-World Capabilities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:20.437616Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2505.08253"},"observation_digest":"sha256:afd4c415a3441a8464c6b6fecdccd2b1ead6ce7b85680de38e0faa1af7857534","observation_id":"f7a25498-4e45-4f51-b8e2-dfb4120f10bb","resolution":{"observed_at":"2026-08-15T22:03:20.437616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T06:35:27.813995Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2505.09388"},"observation_digest":"sha256:ca4e9ae7c66568a2baef8e6d4e81ad80a70109b8bd14865210712a6b7687697c","observation_id":"d3ac7d4f-3fd2-4b35-abfa-1568aaa272c6","resolution":{"observed_at":"2026-05-09T06:35:28.581174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T14:12:05.108016Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-18T21:41:28.663341Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:05.108016Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:1bc08b90a584b50bcbfa7f75032caa72810b40ee80b46104837f8f618c08aa67","observation_id":"0073fe15-f24f-46b0-a18d-b312d982eae9","resolution":{"observed_at":"2026-08-07T14:12:05.108016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T11:56:18.731030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01074","last_updated":"2025-06-01T16:24:13Z","snapshot_observed_at":"2026-08-19T12:08:20.017939Z","submitted_at":"2025-06-01T16:24:13Z","title":"How Programming Concepts and Neurons Are Shared in Code Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:56:18.731030Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.01074"},"observation_digest":"sha256:7697de5be1b41e06b3d9ff20887578ae55e9213c978db2d6b6e29eaf0ffa68da","observation_id":"fd8354c2-1db0-4c14-afcf-87001b2a3695","resolution":{"observed_at":"2026-08-07T11:56:18.731030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T11:04:56.850042Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03524","last_updated":"2025-06-05T03:26:05Z","snapshot_observed_at":"2026-08-13T13:37:23.026438Z","submitted_at":"2025-06-04T03:17:19Z","title":"Seed-Coder: Let the Code Model Curate Data for Itself","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:56.850042Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.03524"},"observation_digest":"sha256:fd7c2a9b2079710247df0d13399abcc615dfc73d3ed357702372111079fa75f3","observation_id":"d6dca7f2-f5cf-484a-bac9-ba33ab5a1375","resolution":{"observed_at":"2026-08-07T11:04:56.850042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T10:35:02.087340Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04894","last_updated":"2025-06-05T11:20:37Z","snapshot_observed_at":"2026-08-15T21:08:06.695656Z","submitted_at":"2025-06-05T11:20:37Z","title":"ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:02.087340Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.04894"},"observation_digest":"sha256:413a3a0f2c7bc987ef7143f4e7408edba7d8c52f189fba7fb095c880f707781c","observation_id":"7d8cdb37-b2b4-48b3-9ac1-14879d128c64","resolution":{"observed_at":"2026-08-07T10:35:02.087340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T05:42:54.942793Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07313","last_updated":"2025-06-08T23:08:08Z","snapshot_observed_at":"2026-08-12T12:30:43.499548Z","submitted_at":"2025-06-08T23:08:08Z","title":"SCGAgent: Recreating the Benefits of Reasoning Models for Secure Code Generation with Agentic Workflows","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:54.942793Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.07313"},"observation_digest":"sha256:0baff394a8cba6330d100d6cb0366604703df14ff1a92d8d383431b608e9a923","observation_id":"39d456e6-5449-4eaa-8845-ed2cdc25096c","resolution":{"observed_at":"2026-08-07T05:42:54.942793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T04:33:08.345343Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-17T19:26:42.531364Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:08.345343Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:78a1a7fea985fbbd528b5dfa472df70fb5cc4da49e9e5a986ac3b9f88d19b58e","observation_id":"89daff14-5780-49b5-be69-a6f71cfab640","resolution":{"observed_at":"2026-08-07T04:33:08.345343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-18T17:58:16.707563Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:07:39.384613Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.11763"},"observation_digest":"sha256:40455a916edf1728e1ce9b819f9b458662bba97612363f39ead8e2ab0c39e150","observation_id":"307f5057-6961-4614-a47e-f71a8c6133cb","resolution":{"observed_at":"2026-05-16T08:07:39.497630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-07T01:08:00.872714Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings.arXiv preprint arXiv:2501.01257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11928","last_updated":"2025-06-13T16:29:09Z","snapshot_observed_at":"2026-08-18T14:38:58.658130Z","submitted_at":"2025-06-13T16:29:09Z","title":"LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T01:08:00.872714Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2506.11928"},"observation_digest":"sha256:6ee1bcdff8603fd65864409655cd749bdce94fb7b57a04b19f7cb96beb95b383","observation_id":"90499ba3-6223-499a-a37c-87532b727c53","resolution":{"observed_at":"2026-08-07T01:08:00.872714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T20:54:39.321936Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01551","last_updated":"2025-07-03T10:33:08Z","snapshot_observed_at":"2026-08-17T11:17:50.501238Z","submitted_at":"2025-07-02T10:05:14Z","title":"Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:54:39.321936Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.01551"},"observation_digest":"sha256:5a672f2184d1e732b36af0e8473be44ccdd1f74a752718fadefc7b1452a6cf92","observation_id":"984bb649-2cce-46ed-8cac-8decff31f390","resolution":{"observed_at":"2026-08-06T20:54:39.321936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T20:42:55.226122Z","title":"CodeElo: Benchmarking competition-level code generation of LLMs with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02130","last_updated":"2025-07-02T20:29:54Z","snapshot_observed_at":"2026-08-21T02:49:14.288294Z","submitted_at":"2025-07-02T20:29:54Z","title":"BACTA-GPT: An AI-Based Bayesian Adaptive Clinical Trial Architect","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:55.226122Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.02130"},"observation_digest":"sha256:2d159d3f36c7caa55b7ce164e3f55a57511da0d52486be5c9d8f5cbc5bac2077","observation_id":"4973fe17-3e77-4718-b797-ff733544a9dc","resolution":{"observed_at":"2026-08-06T20:42:55.226122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T20:24:25.910315Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-17T22:49:53.742436Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:25.910315Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:02ce786ad2e12295c1e3a4989b8e27b0d47b01883e1442a2674357e952470947","observation_id":"99e58958-ce9a-4adf-b53e-55b5051e5786","resolution":{"observed_at":"2026-08-06T20:24:25.910315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T18:12:29.982589Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09089","last_updated":"2025-07-25T00:43:07Z","snapshot_observed_at":"2026-08-20T12:37:15.989838Z","submitted_at":"2025-07-12T00:16:33Z","title":"Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:29.982589Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.09089"},"observation_digest":"sha256:df4b89f25be6fa8545668fd13565583819050972ac70aa98975ec666cac18367","observation_id":"b43dddd9-fb6d-42ab-b506-02f13e1b990b","resolution":{"observed_at":"2026-08-06T18:12:29.982589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T17:35:31.589921Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings.arXiv preprint arXiv:2501.01257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-19T20:11:31.924910Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:35:31.589921Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.10541"},"observation_digest":"sha256:4bf5d43ecd869bb4fa2ad615bf52bfa4272d19ee7edc6aa86847b80d3b44d127","observation_id":"bce54451-14c6-4b2c-aa51-696bf63c5a03","resolution":{"observed_at":"2026-08-06T17:35:31.589921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T12:48:08.423730Z","title":"arXiv preprint arXiv:2501.01257","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21476","last_updated":"2025-07-29T03:44:43Z","snapshot_observed_at":"2026-08-17T16:07:49.762756Z","submitted_at":"2025-07-29T03:44:43Z","title":"Which LLMs Get the Joke? Probing Non-STEM Reasoning Abilities with HumorBench","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:48:08.423730Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.21476"},"observation_digest":"sha256:a30ba053cf3f91b81a564f05d82640cabb75b186bcd25f3dd917087db0ccb8bf","observation_id":"75acb1a9-c225-43a2-9ff5-3e318ecf04b2","resolution":{"observed_at":"2026-08-06T12:48:08.423730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T11:44:34.051268Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22462","last_updated":"2025-08-01T10:07:37Z","snapshot_observed_at":"2026-08-09T15:17:03.370644Z","submitted_at":"2025-07-30T08:08:48Z","title":"IFEvalCode: Controlled Code Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:44:34.051268Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2507.22462"},"observation_digest":"sha256:024517a6131d3d56e89a51e1a893b8920df54718add63db122cae0cb368c568e","observation_id":"1e07aeb6-7577-4eec-a152-401656ddacac","resolution":{"observed_at":"2026-08-06T11:44:34.051268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T21:18:27.805253Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09101","last_updated":"2025-08-12T17:29:20Z","snapshot_observed_at":"2026-08-16T20:46:51.909584Z","submitted_at":"2025-08-12T17:29:20Z","title":"AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:18:27.805253Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2508.09101"},"observation_digest":"sha256:5b95aba83db292a53788c1799b3936a31973c971376cbe19d1069090422b2da1","observation_id":"17e42d19-1e94-48f3-aa19-8c9786923d78","resolution":{"observed_at":"2026-08-05T21:18:27.805253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T17:26:28.894359Z","title":"CodeElo : Benchmarking competition-level code generation of LLMs with human-comparable Elo ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16279","last_updated":"2025-08-22T10:35:56Z","snapshot_observed_at":"2026-08-20T03:36:41.164105Z","submitted_at":"2025-08-22T10:35:56Z","title":"AgentScope 1.0: A Developer-Centric Framework for Building Agentic Applications","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T17:26:28.894359Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2508.16279"},"observation_digest":"sha256:ea9e82e6c8a949617dc28d12fe80fddc0d8965e1e982551ff6617b1717ed3c2c","observation_id":"ed960569-c49f-4db2-8a2c-55242f2ee0fc","resolution":{"observed_at":"2026-08-05T17:26:28.894359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T15:17:13.786271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03537","last_updated":"2025-08-27T17:26:44Z","snapshot_observed_at":"2026-08-20T14:02:14.030298Z","submitted_at":"2025-08-27T17:26:44Z","title":"AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:17:13.786271Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2509.03537"},"observation_digest":"sha256:b451b22a1b29370b594f19208bf16196b9f96b2acf9bc9ccdfd49945f22034bb","observation_id":"bf84de14-32ec-4fa4-bdbf-4020e10daa64","resolution":{"observed_at":"2026-08-05T15:17:13.786271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2509.19349","last_updated":"2025-09-17T17:49:02Z","snapshot_observed_at":"2026-08-15T22:10:58.636387Z","submitted_at":"2025-09-17T17:49:02Z","title":"ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-16T13:58:58.627748Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2509.19349"},"observation_digest":"sha256:e140c20686ffa145b9cce08c36389bcae59d6a96dcfe23b69a72ddf04d987b25","observation_id":"e943bfea-6c25-45fa-bd73-6cb01e8f4444","resolution":{"observed_at":"2026-05-16T13:58:58.872793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-04T11:11:12.184681Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-15T03:51:46.044040Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:11:12.184681Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2510.06672"},"observation_digest":"sha256:ad2276946f78e56bfd44ba9dc6bca2a54010256f68d0999ba785c13b9663f988","observation_id":"cdb9ec5f-aa9d-478d-b68d-d7e2d4219d49","resolution":{"observed_at":"2026-08-04T11:11:12.184681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-03T12:19:33.502600Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-19T23:13:10.681492Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:33.502600Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:549aa6c80beea9a580e461dabedfdd7cf96bc74ed5f6c63b7b87c7adc1c17d8f","observation_id":"5abadc6a-e85d-47df-b5c9-e547f06fe00d","resolution":{"observed_at":"2026-08-03T12:19:33.502600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-03T09:01:32.227320Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15094","last_updated":"2026-06-07T18:11:26Z","snapshot_observed_at":"2026-08-16T21:07:42.967060Z","submitted_at":"2026-01-21T15:33:16Z","title":"Parameter-Efficient Multi-Task Fine-Tuning in Code-Related Tasks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:32.227320Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2601.15094"},"observation_digest":"sha256:c6dfbfe9f68233873994c7fa6e0780ef3f33919aebaf2ec3edb8adc304af2b99","observation_id":"10933620-c4ea-48c7-a354-87fca0c14cac","resolution":{"observed_at":"2026-08-03T09:01:32.227320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-03T03:43:29.252596Z","title":"naacl-industry.2/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07223","last_updated":"2026-05-29T20:44:40Z","snapshot_observed_at":"2026-08-14T11:46:31.172520Z","submitted_at":"2026-02-06T22:12:52Z","title":"Vegas: Self-Speculative Decoding with Verification-Guided Sparse Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:43:29.252596Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2602.07223"},"observation_digest":"sha256:30353affde9691c8a8eba3b4e959409047eb01248187c434cda4ef5fb096325f","observation_id":"657e1a74-7e37-462b-8b5f-a8869b0d60ed","resolution":{"observed_at":"2026-08-03T03:43:29.252596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2604.02721","last_updated":"2026-04-03T04:26:56Z","snapshot_observed_at":"2026-08-16T04:31:15.817344Z","submitted_at":"2026-04-03T04:26:56Z","title":"GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:30:17.791973Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2604.02721"},"observation_digest":"sha256:99e12dc6b9a897266ddf222faadc2b19fded1c87f96f6c0b448faf0b046fcb07","observation_id":"67447ea7-db89-40a5-8f3f-abca1710acf9","resolution":{"observed_at":"2026-05-13T20:33:16.679979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.04779","last_updated":"2026-05-06T11:32:25Z","snapshot_observed_at":"2026-08-15T05:29:55.891655Z","submitted_at":"2026-05-06T11:32:25Z","title":"A meta-analysis of the effect of generative AI on productivity and learning in programming","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:22:26.933712Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.04779"},"observation_digest":"sha256:4679b7a73347086f77af35c01247f2ce8ed61bd48a0cc313d349dbe889f44ba3","observation_id":"764cb704-d7d5-4a82-b4aa-106689f8aed8","resolution":{"observed_at":"2026-05-11T17:41:05.646008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.07307","last_updated":"2026-05-08T06:15:50Z","snapshot_observed_at":"2026-08-17T13:16:53.149758Z","submitted_at":"2026-05-08T06:15:50Z","title":"Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T02:11:19.295354Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.07307"},"observation_digest":"sha256:53faedfe93e3ed3f6bac7688ad742c3a2454124632b57dc9e8d61022c3ddeccd","observation_id":"64b3b35e-2794-4a68-964c-1e0659eff5e9","resolution":{"observed_at":"2026-05-11T03:50:57.504801Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T03:40:04.692279Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:4ca08db8a11f881b12c755332421b842f53e604de6b06161cda78bb710ed4088","observation_id":"7ed6bb66-9a37-4efe-9dec-fe46e2c80605","resolution":{"observed_at":"2026-05-11T03:40:53.378167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T08:14:55.858466Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:34a1ca6aef8c8e05a439a8c7086a7767117e1e423b34d21ccdaafce589694b7f","observation_id":"0eaf367b-58f3-452c-a215-ced211e89e39","resolution":{"observed_at":"2026-05-21T08:19:52.924499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.08478","last_updated":"2026-05-08T20:53:51Z","snapshot_observed_at":"2026-08-15T04:52:44.724030Z","submitted_at":"2026-05-08T20:53:51Z","title":"When Independent Sampling Outperforms Agentic Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T02:46:48.375901Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.08478"},"observation_digest":"sha256:0b11dbbd57a72308b0c97c79142956b4ca130e3871fc6266790d2adc637b9f8c","observation_id":"33283815-219a-4ad1-af20-da60503ea4e9","resolution":{"observed_at":"2026-05-12T07:31:24.569785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.12384","last_updated":"2026-05-12T16:47:40Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:47:40Z","title":"Scalable Token-Level Hallucination Detection in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:23.534294Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.12384"},"observation_digest":"sha256:50ac789366e0a06aba9df5788d47fe23c37028d01be9f7ea1a19bc9cb028d8ed","observation_id":"8fcaa0af-3e5c-4808-8f18-4c8ca527c9d8","resolution":{"observed_at":"2026-05-13T05:52:22.415561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.15301","last_updated":"2026-05-14T18:15:09Z","snapshot_observed_at":"2026-08-15T21:06:47.522910Z","submitted_at":"2026-05-14T18:15:09Z","title":"Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T16:28:23.113976Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.15301"},"observation_digest":"sha256:e12470a3e13f337cebbf893b6c5ef5f7fda6fbb3a1ca28e439f0a88e67488f36","observation_id":"c269d1fe-9e67-4a66-ba22-0081522b6f8c","resolution":{"observed_at":"2026-05-19T16:32:39.503059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-08-14T16:04:44.826365Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T14:52:33.141693Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:645daed5876ab3784068de08dacb16a2b64d6340b4ba159536097d83d36a0e78","observation_id":"0cfd1dbb-04aa-42a4-a833-1b170a907e2c","resolution":{"observed_at":"2026-05-20T14:53:23.261829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-08-14T16:04:44.826365Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:060db1b7f2bceb43679e8e00aa3497fa31055c1eb7d69d77864c44bc0bfc4428","observation_id":"d0b9eb4a-8f38-4e2e-b05c-42ed6bf2bafe","resolution":{"observed_at":"2026-06-30T19:05:00.422916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2605.30394","last_updated":"2026-05-28T13:48:23Z","snapshot_observed_at":"2026-08-16T18:25:35.362991Z","submitted_at":"2026-05-28T13:48:23Z","title":"CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T06:25:56.404246Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2605.30394"},"observation_digest":"sha256:a3df102ecad6756206786a98914dd1c72026c06657849fdf8fd8a082082f77d0","observation_id":"4e2da0ee-e08a-4f50-bc67-3d540bdada9c","resolution":{"observed_at":"2026-06-29T14:33:31.675895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-11T18:07:40.444367Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:e1640b1c9a87bf1287a6886cb86eb5646a07166ca0beb09c988dac4972077efa","observation_id":"38913d1a-1d2f-4d63-be86-4cc366c79fe7","resolution":{"observed_at":"2026-07-04T06:29:38.282952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-15T00:00:21.528560Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:15.784610Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:25b47de7b9ded2e0800960163d3cd979dc72028796d33118abac29ff238747b2","observation_id":"50834b1b-e859-45ec-91b6-7194cab1928d","resolution":{"observed_at":"2026-07-04T20:00:08.073584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-15T00:00:21.528560Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:21.598397Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:228d5cd5d4d25ce45247c81f0f6a30bdc5c00983c75b0c2ca29b39d9354066da","observation_id":"fc0d15ef-6e2d-4e85-b267-a5672e39e6f3","resolution":{"observed_at":"2026-07-04T13:09:50.536539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:ceac4fd5b68bf357b75888dd1850102342f1f9bc07bd99d514227a42cb6747d5","observation_id":"8a0297f1-5296-4827-865e-a8e650d38072","resolution":{"observed_at":"2026-07-02T19:07:17.121388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2607.07748","last_updated":"2026-07-08T09:18:56Z","snapshot_observed_at":"2026-08-06T15:26:59.961118Z","submitted_at":"2026-07-08T09:18:56Z","title":"Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T19:48:27.137130Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.07748"},"observation_digest":"sha256:8c630824031623ee4b031acdc283d9eabd90cb8fb8ca177061beed38754f91c9","observation_id":"673b4857-0913-4c36-9044-6e0828a42c0f","resolution":{"observed_at":"2026-07-10T19:57:34.142769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":"2501.01257","doi":"10.48550/arxiv.2501.01257","metadata_source":"pith","pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings","venue":"cs.CL","work_id":"0e51dc65-57bb-4087-88e2-fae021a4fec7","year":2025},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-13T06:08:17.610900Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:42f39676bc9e314568d9cc357b2f46ba98d1ef8f5509b86afe91f57453aa49ab","observation_id":"afd13c9d-edc2-4bca-8b40-b167ed868f64","resolution":{"observed_at":"2026-07-10T13:57:06.683592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-02T03:32:56.869485Z","title":"CodeElo: Benchmarking competition-level code generation of LLMs with human-comparable Elo ratings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14181","last_updated":"2026-07-15T14:05:33Z","snapshot_observed_at":"2026-08-18T06:45:06.018281Z","submitted_at":"2026-07-15T14:05:33Z","title":"Quantize with Confidence? An Empirical Study of Quantization for Code Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T03:32:56.869485Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.14181"},"observation_digest":"sha256:54ea831bb0f01786908b2ff6b20c4d31c7e47fc51188d68803389e31ee1905a7","observation_id":"6e143a64-a9d3-4332-8676-c5b4560bf0d4","resolution":{"observed_at":"2026-08-02T03:32:56.869485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-01T14:11:55.543471Z","title":"Codeelo: Benchmarking competition-level code generation of llms with human-comparable elo ratings,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18859","last_updated":"2026-07-21T08:49:30Z","snapshot_observed_at":"2026-08-19T17:53:59.462413Z","submitted_at":"2026-07-21T08:49:30Z","title":"PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T14:11:55.543471Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.18859"},"observation_digest":"sha256:e30d0a3fbf1485fc55515f8b80c3187268498762cb3728801d5408648de94fad","observation_id":"c609dd5c-a15f-49bc-a80a-45d142a36396","resolution":{"observed_at":"2026-08-01T14:11:55.543471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-01T05:52:42.177022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22098","last_updated":"2026-07-24T08:48:17Z","snapshot_observed_at":"2026-08-18T05:44:23.851461Z","submitted_at":"2026-07-24T08:48:17Z","title":"Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T05:52:42.177022Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.22098"},"observation_digest":"sha256:a8f91701ab3ad7b35c55be32e04ea6118d72006a20915885515ba1c4f66be7bb","observation_id":"55439718-bb99-4fd1-9316-b29d5bf06fa2","resolution":{"observed_at":"2026-08-01T05:52:42.177022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-01T15:29:54.308202Z","title":"Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26457","last_updated":"2026-08-04T08:18:00Z","snapshot_observed_at":"2026-08-15T21:08:57.851438Z","submitted_at":"2026-07-29T04:16:33Z","title":"DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:54.308202Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.26457"},"observation_digest":"sha256:0f7814b703a327f8c66122f89fb1a42ed11adbc5350db3fefcf292b447435be2","observation_id":"c42abb11-d600-4e65-87ea-38efbb551916","resolution":{"observed_at":"2026-08-01T15:29:54.308202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-05T04:27:42.973857Z","title":"Rafailov, R.; Sharma, A.; Mitchell, E.; Manning, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26457","last_updated":"2026-08-04T08:18:00Z","snapshot_observed_at":"2026-08-15T21:08:57.851438Z","submitted_at":"2026-07-29T04:16:33Z","title":"DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:27:42.973857Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2607.26457"},"observation_digest":"sha256:29dd454f935842ccffcb9da0a8746cdfb4a3f37270b7fef0737b7dddb0fc3e85","observation_id":"956cc784-859b-4068-b5b5-4853613f2aa1","resolution":{"observed_at":"2026-08-05T04:27:42.973857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-04T00:43:21.537277Z","title":"CodeElo: Benchmarking competition-level code generation of LLMs with human-comparable Elo ratings.arXiv preprint arXiv:2501.01257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00355","last_updated":"2026-07-31T23:58:25Z","snapshot_observed_at":"2026-08-17T05:46:56.459045Z","submitted_at":"2026-07-31T23:58:25Z","title":"CurveShift: Is Agent Progress Scalar? Separating Level from Shape","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T00:43:21.537277Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2608.00355"},"observation_digest":"sha256:2e8d7a3860d411c5f5993e95e0002536c8a48c6a0c107c16fc10c2bebc510b25","observation_id":"7b0e0aff-407c-4cf3-8c50-52c0e21cf427","resolution":{"observed_at":"2026-08-04T00:43:21.537277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01257","snapshot_observed_at":"2026-08-06T16:30:09.691906Z","title":"CodeElo: Benchmarking competition-level code generation of LLMs with human-comparable elo ratings.arXiv preprint arXiv:2501.01257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04794","last_updated":"2026-08-05T12:59:10Z","snapshot_observed_at":"2026-08-16T22:55:26.699493Z","submitted_at":"2026-08-05T12:59:10Z","title":"Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:09.691906Z"},"links":{"cited_paper":"/paper/2501.01257","citing_paper":"/paper/2608.04794"},"observation_digest":"sha256:f84e082e32e60f655777845ff322a2c6ff7e4cd01dea883bb7b5934798033832","observation_id":"67a66d07-2ecf-47b6-9302-3ae9a415e5a6","resolution":{"observed_at":"2026-08-06T16:30:09.691906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01257/citation-record","integrity":"/paper/2501.01257/integrity","json":"/paper/2501.01257/citation-record.json","paper":"/paper/2501.01257"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-10T22:37:58.399925Z","title":"Jacob Austin, Augustus Odena, Maxwell Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie Cai, Michael Terry, Quoc Le, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.399925Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:84a7d449b8f064f9770658d91885f22496c138ec26328a0f4965c9e92e4aefae","observation_id":"b772444c-d80b-42a2-a4d5-6e66bf30def7","resolution":{"observed_at":"2026-08-10T22:37:58.399925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:37:58.408634Z","title":"Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Amy Yang, Angela Fan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.408634Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:3acf7ab1aeea42a2913966375aaca046e0f4aae58b097c231527366b6abb9793","observation_id":"88158010-b2c5-493d-ba48-a9e991195b3a","resolution":{"observed_at":"2026-08-10T22:37:58.408634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.860175Z","title":"(2024) - o1-mini OpenAI (2024a) - Qwen2.5-Coder-1.5B-Instruct Hui et al","venue":null,"work_id":"a1cf3044-7ea4-48f7-bc22-2dfd2d0f19cd","year":2024},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.485989Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:53da29cc71f9a546a3349a9dec36341fb602848c04740b2b13cde105aabcc7ab","observation_id":"17dd5632-809a-4f61-b35c-7578a9275979","resolution":{"observed_at":"2026-08-10T22:37:58.863972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-10T22:37:58.417005Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.417005Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:50a5fa1ab2b674bbdb1131dcfdc3dd4b772b24eb0fdf81ec22152e3febf11df9","observation_id":"6dd21d7b-f2a0-4048-9420-f08e9fb966e3","resolution":{"observed_at":"2026-08-10T22:37:58.417005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03945","last_updated":"2023-05-19T17:42:56Z","snapshot_observed_at":"2026-08-20T21:15:17.921228Z","submitted_at":"2022-10-08T07:27:17Z","title":"Understanding HTML with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03945","snapshot_observed_at":"2026-08-10T22:37:58.421209Z","title":"Understanding html with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.421209Z"},"links":{"cited_paper":"/paper/2210.03945","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:3cdfc92234e798acd52065b1c923231c1f803c762c7ec86069ed4a5766222c90","observation_id":"26e54c3c-dcf0-48a2-96ed-46ab41d35371","resolution":{"observed_at":"2026-08-10T22:37:58.421209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.836485Z","title":"abc\", acceptable outputs could include","venue":null,"work_id":"6851225d-c6ea-49e8-8ae0-bee5a23c49d4","year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.494276Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:c7bf4286c00944e54a6f02c364f48c82247cdbe0400eec44eb851479e09b63e2","observation_id":"83a150fd-a97b-42b2-8d1a-7e984b875e57","resolution":{"observed_at":"2026-08-10T22:37:58.840939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-16T13:02:01.818557Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-10T22:37:58.429313Z","title":"Opencoder: The open cookbook for top-tier code large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.429313Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:c5979fc8d315a117b890d617aeac37d04eeb2ab0c55e77bbeb2de2e29ca41ba0","observation_id":"2e877dc5-c25c-40d0-82fa-a26b61ba6695","resolution":{"observed_at":"2026-08-10T22:37:58.429313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-10T22:37:58.433146Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.433146Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:6df0e453d1fe383d84dc19e6dc62e84973c95acc566d20e5c26e17dfc0235c66","observation_id":"321408de-878e-48b8-8417-a416e6f32739","resolution":{"observed_at":"2026-08-10T22:37:58.433146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T22:37:58.437135Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.437135Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:8d53ff2ff51f83669f232b5fb7dd76e351f992fa07ff10f34262878341450abb","observation_id":"d0001b78-c5fb-48dc-aea4-31ebea6e08f7","resolution":{"observed_at":"2026-08-10T22:37:58.437135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-10T22:37:58.440684Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.440684Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:cc4e76c5a100b805622a62f1b417bb49e96aa951d248ae2e7688f80612da921b","observation_id":"ff8bec78-c878-4303-8ae5-41bfe2803048","resolution":{"observed_at":"2026-08-10T22:37:58.440684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T22:37:58.444503Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.444503Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:31e3af68894ea3e7e29a3376e4d36713e0d5d6d51637c676d99d75143e207239","observation_id":"c1aeb3b1-fc3b-4341-888c-e070d678e16c","resolution":{"observed_at":"2026-08-10T22:37:58.444503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03004","last_updated":"2023-11-06T07:16:58Z","snapshot_observed_at":"2026-08-20T01:11:40.396610Z","submitted_at":"2023-03-06T10:08:51Z","title":"xCodeEval: A Large Scale Multilingual Multitask Benchmark for Code Understanding, Generation, Translation and Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03004","snapshot_observed_at":"2026-08-10T22:37:58.451483Z","title":"xcodeeval: A large scale multilingual multitask benchmark for code understanding, generation, translation and retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.451483Z"},"links":{"cited_paper":"/paper/2303.03004","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:b72299fdd7c156c690dda21fd54b24eab7cf45ef0eecb3493962d6a771231df2","observation_id":"a5f18db5-4279-4d3e-ae74-69077925e2ad","resolution":{"observed_at":"2026-08-10T22:37:58.451483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-18T07:56:10.424560Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-10T22:37:58.454843Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.454843Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:91477d164040fbb80d07ee475aec3eff4f0d0b947af03972289b85d0a83b8650","observation_id":"0704a626-34ac-4c4f-a57f-44a51bcae9e7","resolution":{"observed_at":"2026-08-10T22:37:58.454843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T22:37:58.458249Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.458249Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:112277e27833dbd26dd1dc001beedec6cd8c4943ea017ae4dcc83bcf83a20b31","observation_id":"c23b738d-afc2-495b-97df-a64d1b3f2a41","resolution":{"observed_at":"2026-08-10T22:37:58.458249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.870970Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"aa5e8a45-11e9-48ab-a4d9-4d98645d13f5","year":2024},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.461544Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:fdf17e81d748c8506b41cef2b7495b071a23bbbff8237beed209fdc1b4c2ea51","observation_id":"a25242d0-112a-4156-a918-5d7d2e5af09c","resolution":{"observed_at":"2026-08-10T22:37:58.874826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"-mini-announcement/1061818","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.651774Z","title":null,"venue":null,"work_id":"bdbb8db9-743d-4f1d-8c7a-afd5651c5674","year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.464950Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:cc6e8692b1f93f6d53776b2f953813d58a9fea7e18df5c6f1d9b5e52989e1463","observation_id":"05901e81-50bc-4c0f-9b2e-a587bfe1aac1","resolution":{"observed_at":"2026-08-10T22:37:58.659524Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10952","last_updated":"2024-04-16T23:27:38Z","snapshot_observed_at":"2026-08-17T22:31:18.912484Z","submitted_at":"2024-04-16T23:27:38Z","title":"Can Language Models Solve Olympiad Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10952","snapshot_observed_at":"2026-08-10T22:37:58.468295Z","title":"Can language models solve olympiad programming? arXiv preprint arXiv:2404.10952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.468295Z"},"links":{"cited_paper":"/paper/2404.10952","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:5d278aa230334e325f22dbbb67277745c4d738fc249b2a5e37e7cc40f7f59f64","observation_id":"410498c9-dafa-4952-9c4e-0f48923cabe9","resolution":{"observed_at":"2026-08-10T22:37:58.468295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24198","last_updated":"2024-11-01T16:06:10Z","snapshot_observed_at":"2026-08-19T12:48:35.963543Z","submitted_at":"2024-10-31T17:55:13Z","title":"SelfCodeAlign: Self-Alignment for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24198","snapshot_observed_at":"2026-08-10T22:37:58.471707Z","title":"Codestral: Hello, world!, May 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.471707Z"},"links":{"cited_paper":"/paper/2410.24198","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:90927c304b5d127e08ab6d6ee1cc953659332c681cd3bb0ce60ce6bea5b7d1ff","observation_id":"cf1502dd-0247-4114-9829-c97e27dc20f0","resolution":{"observed_at":"2026-08-10T22:37:58.471707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T22:37:58.475033Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.475033Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:f1e882d021229e93378d7478cd1fe1435212f5eeb79147e787c33d8b86abd9e4","observation_id":"e65110a8-14fb-4ebc-b65e-67560475f45a","resolution":{"observed_at":"2026-08-10T22:37:58.475033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-10T22:37:58.478693Z","title":"Deepseek-coder-v2: Breaking the barrier of closed-source models in code intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.478693Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:f64d2222c8832cef655ade4119e4db27266e0432056cd6f07ffab44bc3db3b97","observation_id":"bf128bdd-9cf7-4ea2-b372-48d974124012","resolution":{"observed_at":"2026-08-10T22:37:58.478693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-08-21T04:02:37.589002Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-10T22:37:58.482301Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.482301Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:714a49c0f4da278575341c0c05a3f93eed7dbc71b4789b8cacfd38a61cffefe9","observation_id":"69cfdfb7-2358-43f3-8ebc-89730dd5a836","resolution":{"observed_at":"2026-08-10T22:37:58.482301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.849411Z","title":"Namely, the new rating can be calculated using the formula ri = ri−1+E(ri) 2","venue":null,"work_id":"993ef58d-2de5-434a-ad69-24591adf8c1f","year":1916},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.490026Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:0a0c0d14df1b4b86ca2932b8f3f538f98650c3cf9c8a5fcffff5fbc5b4ad795a","observation_id":"f4e100ea-b366-4e14-b4e7-5be57b7e319b","resolution":{"observed_at":"2026-08-10T22:37:58.853078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-10T22:37:58.412771Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.412771Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:49941e5ef17b77cb27777253c7e5dd1ceb75e81af036ff665ae444624f8dc619","observation_id":"30800675-fe33-4030-8767-e9e2aca13a71","resolution":{"observed_at":"2026-08-10T22:37:58.412771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T22:37:58.404474Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.404474Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:5aceb4349b79a9d7bafc79363eedb045fca779ee07be264376c338d4a9fc60eb","observation_id":"a39333c0-5da3-469d-ad83-5222024ccd1d","resolution":{"observed_at":"2026-08-10T22:37:58.404474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-10T22:37:58.425527Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.425527Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:97af28177419587c701e81a6de32850f9da6302481ff3afc8f308e9dcdee17df","observation_id":"41b15a40-e11d-47b6-9cbe-12c1231a312f","resolution":{"observed_at":"2026-08-10T22:37:58.425527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T22:37:58.448033Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.448033Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:8c2615a8b8668b6ed1d839e58d59bc62ee58c1bff42ac3651c51660eccf94806","observation_id":"2364059a-7b44-492a-a8ee-61690f8fd4b7","resolution":{"observed_at":"2026-08-10T22:37:58.448033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:37:58.882374Z","title":"io/blog.html?post=en/2024-09-05-A-Small-but-Mighty-LLM-for-Code.md","venue":null,"work_id":"1d158104-e0c6-402f-9123-8f5a987d8ec0","year":2024},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.395499Z"},"links":{"citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:37be917fa6e2d78337e8893bc2bf14b8ec89809dae6b0124c61d19adcee55c56","observation_id":"fc2795d0-aa38-481f-b493-40bf8d7571c1","resolution":{"observed_at":"2026-08-10T22:37:58.886501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T05:16:26.684195Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 50 inbound Pith citation observations for arXiv:2501.01257."}