{"as_of":"2026-08-07T15:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7849b3f5fe02602ec425799dd356e37341f99172d604a8a1551fcacbbe9a00ef","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:59:57.155640Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:23:18.237307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"cited_work":{"arxiv_id":"2506.12278","doi":"10.48550/arxiv.2506.12278","metadata_source":"pith","pith_arxiv_id":"2506.12278","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","venue":"cs.SE","work_id":"cecd1cdb-d063-49cd-9ed5-edeef953eec3","year":2025},"citing_paper":{"arxiv_id":"2608.01715","last_updated":"2026-08-03T05:24:03Z","snapshot_observed_at":"2026-08-07T09:40:32.601228Z","submitted_at":"2026-08-03T05:24:03Z","title":"Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:23:18.237307Z"},"links":{"cited_paper":"/paper/2506.12278","citing_paper":"/paper/2608.01715"},"observation_digest":"sha256:99b76dd34fe09a07d7acdf6f109b4074d03928ea837a518265f98610c8afbbfe","observation_id":"e45ec79c-5879-4031-a6ac-3a2f2c27ff7c","resolution":{"observed_at":"2026-08-04T22:23:18.639334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12278/citation-record","integrity":"/paper/2506.12278/integrity","json":"/paper/2506.12278/citation-record.json","paper":"/paper/2506.12278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.449687Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.449687Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:6fca132d81d7e04fec40a2a499e5a4944b0e7ad414729e5ffd7a7b16904d481d","observation_id":"8b2839ec-2f8c-47cd-80a4-0d0fccdb0135","resolution":{"observed_at":"2026-08-07T00:59:55.449687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.488543Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.488543Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:553cf4982a20b33d63c1f40d913436cb2d3025655b134158bf2d762a49096f01","observation_id":"6bae24c5-efac-42ed-8b35-d3c0a7b056f8","resolution":{"observed_at":"2026-08-07T00:59:55.488543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:59:55.528534Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.528534Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:2a25fba66752d2d362db640931c179b9a604b9893d48bb7e4e51b3c465729708","observation_id":"9357e788-225b-474c-a621-88c5dadac4e2","resolution":{"observed_at":"2026-08-07T00:59:55.528534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-07T00:59:55.577526Z","title":"Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.577526Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:0424bc2828f3c565f30c664245f22ac0323f16a6016f9eb629026344a011a175","observation_id":"f0fcd630-95d4-4a1c-8cf3-72eac5cb2b66","resolution":{"observed_at":"2026-08-07T00:59:55.577526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.491713Z","title":null,"venue":null,"work_id":"911ff8b7-7fa4-449f-bb6d-4854a3b068ed","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.643613Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:79c2aa81f6f635a75a1dad1f87d7f9f8fa6191667e335071b140f34d2b1a59e3","observation_id":"2c973e75-acea-4a9d-9d4b-13a3edf2bd11","resolution":{"observed_at":"2026-08-07T00:59:58.535412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.370979Z","title":null,"venue":null,"work_id":"6221f9f6-90a3-4791-bf4d-07bbc758ddab","year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.697873Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:1dfc6bbac436b55eadd45c1e1c8e00c49c9722627dfb4275a1ff0471cabcbe92","observation_id":"5ec18424-40c3-4059-ab3c-58815dc5dec9","resolution":{"observed_at":"2026-08-07T00:59:58.441772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.191243Z","title":null,"venue":null,"work_id":"ec621d16-468c-4522-ba52-a5d451cb3205","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.749505Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:6badd0a00cbac6a9a22b31adcbb810c04a40725726f2f72e497d72bf8570f29d","observation_id":"b6de7f7d-4bb7-4f45-b2d0-b29c985193c0","resolution":{"observed_at":"2026-08-07T00:59:58.293660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T00:59:55.796486Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.796486Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:4144800829395cfa29d33993983bd181591dde6563164df23422631de5ef590f","observation_id":"4758ddc3-7b90-4bbe-82f4-52b61c663c71","resolution":{"observed_at":"2026-08-07T00:59:55.796486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.073497Z","title":null,"venue":null,"work_id":"f269cd97-1eea-41a1-8e71-8b3c4daeca96","year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.840677Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:d2f298ad7bbbfcd8d073b0d07417d845fa6aa4b01eceff9ce19001e80b8eedd3","observation_id":"6d0816bf-0534-4ead-8f52-90685a61d73d","resolution":{"observed_at":"2026-08-07T00:59:58.125813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T00:59:55.909403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.909403Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:02dbf3bdcc074b1f3469fd07aff03982fed866b3dfc1215f165d3738561e65f5","observation_id":"579d2730-740a-4c4a-b838-42d053e23109","resolution":{"observed_at":"2026-08-07T00:59:55.909403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T00:59:55.967202Z","title":"Wang, Armando Solar-Lezama, Koushik Sen, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.967202Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:3baaf920fd0baf8c3cc8a42cc7ca3944e2d1b1daac8f95d94d54d826ab97f510","observation_id":"7d885ef1-8f1a-4e6d-8d0b-4b74e4a8a81a","resolution":{"observed_at":"2026-08-07T00:59:55.967202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:59:56.011602Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.011602Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:b112e2935b26446f8ca8278da348f31a3d6ab703e521b49cb828ce913196dde2","observation_id":"72f97c88-b4e1-481f-8359-f5d747b3c45d","resolution":{"observed_at":"2026-08-07T00:59:56.011602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16345","last_updated":"2025-02-14T09:32:11Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T12:44:02Z","title":"Preference Optimization for Reasoning with Pseudo Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16345","snapshot_observed_at":"2026-08-07T00:59:56.058442Z","title":"Chen, Shafiq Joty, and Furu Wei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.058442Z"},"links":{"cited_paper":"/paper/2411.16345","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:5018e068ca9022194663e96fd77c84d7a021f216573cabb8bfe6fa824ffa04d4","observation_id":"e8e3f768-a80e-443a-9303-c26bbbe2ec9a","resolution":{"observed_at":"2026-08-07T00:59:56.058442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T00:59:56.102230Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.102230Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:1c22f7dbc7e13f50f1d1a383339c1044a3732b85dcf4dbc522bd2ffdf79a8d2e","observation_id":"1ab15e48-f62f-414a-b04d-f652a415dbcc","resolution":{"observed_at":"2026-08-07T00:59:56.102230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03004","last_updated":"2023-11-06T07:16:58Z","snapshot_observed_at":"2026-07-06T14:59:03.634181Z","submitted_at":"2023-03-06T10:08:51Z","title":"xCodeEval: A Large Scale Multilingual Multitask Benchmark for Code Understanding, Generation, Translation and Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03004","snapshot_observed_at":"2026-08-07T00:59:56.156125Z","title":"Rizwan Parvez, and Shafiq R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.156125Z"},"links":{"cited_paper":"/paper/2303.03004","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:386df6778f671f10b297f7fd520771e21cdb2e34daf135803cef351b45e5761e","observation_id":"8e088c84-d7d5-4cc4-ac74-4ab1c6de13d2","resolution":{"observed_at":"2026-08-07T00:59:56.156125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.945238Z","title":null,"venue":null,"work_id":"d032380a-8007-4862-9b55-7ac8ae5cbd11","year":2022},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.214726Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:79c26a4ccb3f14f1dabe68da80b6b69530474d08b43f9ddaa8ed5a936a9442ce","observation_id":"1f386c15-9adc-4574-8705-18903fad0810","resolution":{"observed_at":"2026-08-07T00:59:57.995930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-07T00:59:56.261209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.261209Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:ecf7d163eb3921c81b582991472bcb5b86f2c5f88aff8a5a2de55b587863a1d7","observation_id":"7225e502-4e22-4b42-8d75-dfaad8008844","resolution":{"observed_at":"2026-08-07T00:59:56.261209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:59:56.303293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.303293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:debfe1000f7082dd687a4951b8a005992cf826f13de7fb024dad574763b4f7c4","observation_id":"84c7e1cf-d8ef-41dd-b371-cce4142af3e8","resolution":{"observed_at":"2026-08-07T00:59:56.303293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.348914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.348914Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:50dfc531cec251cce771d29474094dc569e4304a3be845dbca106cd4961219b2","observation_id":"6c82f0ca-7153-41d4-ad1d-71a6882961f5","resolution":{"observed_at":"2026-08-07T00:59:56.348914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.419184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.419184Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:9cfa69ff0d2714e8259c3bff129dbadb8d561557e0a999c021c7376565a60648","observation_id":"cd7fbad9-537e-4b7d-8d93-047f1f0cd5fa","resolution":{"observed_at":"2026-08-07T00:59:56.419184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.774410Z","title":null,"venue":null,"work_id":"e346c83a-3019-4b4b-a395-1342ec86ac19","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.484715Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:ebecab704b2f1922ca96c609bdd1ed8e75c844caba6ebf98f6f1398f4785d198","observation_id":"248077a6-a411-41f8-99c7-4985da679302","resolution":{"observed_at":"2026-08-07T00:59:57.832291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.670257Z","title":null,"venue":null,"work_id":"f04e43d6-a8c5-4d3f-8724-532557e63547","year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.532100Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:bd97ec33811e0033128e0c31227d1c7f5b47b6822cf207c70862e0b8c23a3db6","observation_id":"810dafbc-04e9-4c04-99f7-dc9cec0e641b","resolution":{"observed_at":"2026-08-07T00:59:57.722344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T00:59:56.591993Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.591993Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:135a7ff4141dc9450738fd6c1c671d38b8a2e09cb89fe8f1c3f494fa47e3b405","observation_id":"b5959592-d82d-4bd1-9378-89fa9519ac30","resolution":{"observed_at":"2026-08-07T00:59:56.591993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.527032Z","title":null,"venue":null,"work_id":"b5ad20d9-b611-427d-a683-2fcd2b18fff8","year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.648323Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:7b95603632a1a9cef65d84d2bce5b90c7eff3b36e7799033508f8f5033c21153","observation_id":"4cf7ca66-c79b-4ff0-9773-ddb70e485aa2","resolution":{"observed_at":"2026-08-07T00:59:57.569425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.704854Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.704854Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:0841ffc0904a63017e5b81a4a3662d313fafa648955a1130112d9746feb2ef1e","observation_id":"e6092ee4-0bcb-4b59-9662-6d0b599e2ddb","resolution":{"observed_at":"2026-08-07T00:59:56.704854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T00:59:56.751560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.751560Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:f0d7af32ff54b82b0f04f77f7a399dcdc87eecda9d3ba3fb905cc7b1923137d4","observation_id":"572a3131-a99b-4f23-952b-17e21831f1ab","resolution":{"observed_at":"2026-08-07T00:59:56.751560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:59:56.812729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.812729Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:8ee764578e44d43c339d87e6c5e85a169c95b2eb24a1c7c0e4038848ec7787af","observation_id":"82778f0a-c4d0-4191-882f-3d21a15b90c5","resolution":{"observed_at":"2026-08-07T00:59:56.812729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:59:56.888058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.888058Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:8f91bfe08ca042538a55e950b4892235354c2550198c2921ff71971db6e62db3","observation_id":"037b10f5-6452-4d97-8b18-524b3ee79a94","resolution":{"observed_at":"2026-08-07T00:59:56.888058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:59:56.935507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.935507Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:6de0f87fd7593514e369db99a1604af2ec2724507710becb457433da3b6300cf","observation_id":"4d7f9b05-be02-4689-b1e4-4e1934392f1d","resolution":{"observed_at":"2026-08-07T00:59:56.935507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-08-06T14:11:44.657165Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21199","snapshot_observed_at":"2026-08-07T00:59:57.050750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.050750Z"},"links":{"cited_paper":"/paper/2412.21199","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:52d2a70a23163aceaf550d08282f34c24c46989a0aca6460f18fe72ef46daea4","observation_id":"87e3b6f0-bf66-4c79-a1bc-9e4cc155d542","resolution":{"observed_at":"2026-08-07T00:59:57.050750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.404968Z","title":null,"venue":null,"work_id":"909e2709-77cd-488a-b4f4-a6e239d41d00","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.100392Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:d58abd6ad161de01549422d4f5cb75f61f6130c2176d3d999576d257890d7074","observation_id":"7f58fb4c-a7b5-49c2-a05d-1aa415111917","resolution":{"observed_at":"2026-08-07T00:59:57.459436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14591","last_updated":"2023-12-08T00:12:58Z","snapshot_observed_at":"2026-08-06T06:52:21.527894Z","submitted_at":"2023-05-24T00:10:15Z","title":"ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle Verifiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14591","snapshot_observed_at":"2026-08-07T00:59:57.155640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.155640Z"},"links":{"cited_paper":"/paper/2305.14591","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:364d832275b6faa9cc4a696dd4cbe8ee53841dd75df9fb0375eb1d16e11abdad","observation_id":"96f2f7ac-5c99-4447-b9bd-70e4f8488d2b","resolution":{"observed_at":"2026-08-07T00:59:57.155640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T00:52:00.846828Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2506.12278."}