{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:306c257c5b041da91f10df08468b7038d3e9604e89be0b35691469e2802a476a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:59.087204Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:58:27.773874Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.065119Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-08-06T00:58:27.773874Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05686","last_updated":"2025-08-06T05:04:14Z","snapshot_observed_at":"2026-08-08T18:44:44.258638Z","submitted_at":"2025-08-06T05:04:14Z","title":"Efficiency of turbulence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:58:27.773874Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2508.05686"},"observation_digest":"sha256:fc7baaaf3e201e13215a52581bac09c161f85875f0b9a97e738b5bb3298f4c94","observation_id":"57da5526-4a26-4dbb-8eed-1f45a9385867","resolution":{"observed_at":"2026-08-06T00:58:27.773874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2604.21138","last_updated":"2026-04-22T22:58:47Z","snapshot_observed_at":"2026-07-06T23:07:47.244208Z","submitted_at":"2026-04-22T22:58:47Z","title":"Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-09T23:27:54.704794Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2604.21138"},"observation_digest":"sha256:fc88c39675e0f5f21c71a232dc426c26180eb5d51c29f061f8902fbdce4bbff6","observation_id":"bb1423bc-89a7-4034-949f-64dd43891641","resolution":{"observed_at":"2026-05-11T14:06:05.487820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.08553","last_updated":"2026-05-08T23:25:05Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-08T23:25:05Z","title":"VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:21:42.562823Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.08553"},"observation_digest":"sha256:2f30810c32f08bda60e59f124e4968b26933efdb759be229fe4e0aa4d4981150","observation_id":"02a07b45-6973-4a29-84d8-0db561655f4d","resolution":{"observed_at":"2026-05-12T08:01:32.448442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.14445","last_updated":"2026-05-14T06:39:42Z","snapshot_observed_at":"2026-08-01T15:27:40.908509Z","submitted_at":"2026-05-14T06:39:42Z","title":"FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:02:25.597640Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.14445"},"observation_digest":"sha256:f8c6d1bfbe85fdfb648808907a96c211b3df1b457c78ae9bfd38519721ecd503","observation_id":"7f72180a-fb8a-48f2-93ee-2b50f2e2cfc5","resolution":{"observed_at":"2026-05-15T02:03:29.053765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.24693","last_updated":"2026-05-23T18:13:41Z","snapshot_observed_at":"2026-08-03T16:34:39.940462Z","submitted_at":"2026-05-23T18:13:41Z","title":"CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:19:22.541146Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.24693"},"observation_digest":"sha256:3762b2bb833d176039d6375b004da6b4eae2054dc3e0125f421fe4290f50357d","observation_id":"c6f235e1-2126-485a-a8bb-23a8c8e84267","resolution":{"observed_at":"2026-06-30T13:24:40.201084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:15.784610Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:07107cd66474e0ce6a777c05892101f7869b6dea9e5c9e2ba22b195eab78004f","observation_id":"99f18f25-3205-49c3-8e8a-86caaa7b88ff","resolution":{"observed_at":"2026-07-04T20:00:08.067026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:21.598397Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:0a76aebdb202ac821a5b1d2d86229b07401bff2e64b73c220a5d9dd075750b98","observation_id":"b618dcfd-225a-4794-85de-af1428477042","resolution":{"observed_at":"2026-07-04T13:09:50.596811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-08-04T22:23:16.109674Z","title":"Hardtests: Synthesizing high-quality test cases for llm coding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01715","last_updated":"2026-08-03T05:24:03Z","snapshot_observed_at":"2026-08-07T22:47:51.608048Z","submitted_at":"2026-08-03T05:24:03Z","title":"Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:23:16.109674Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2608.01715"},"observation_digest":"sha256:e654b119e820e31505e71d5d5cc3bea620dd2d4a36768ea34d699e78eae33c99","observation_id":"0aa7b6c7-458a-4bf8-a924-98bbb9ae9c7b","resolution":{"observed_at":"2026-08-04T22:23:16.109674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24098/citation-record","integrity":"/paper/2505.24098/integrity","json":"/paper/2505.24098/citation-record.json","paper":"/paper/2505.24098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.202694Z","title":"1 1 0\\n1000000000\\n1000000000","venue":null,"work_id":"43a080bc-bcd5-4a07-bcfd-4937c5b34b1b","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:59.087204Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:eb1e2a26760c96d586281b6b73858e9afcf1a487894a23cdca568e86c9edee7a","observation_id":"d8a05b95-d4d3-4b7c-b4df-3ee993ddfcb5","resolution":{"observed_at":"2026-08-07T12:40:00.263496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.707156Z","title":"123 * The Python code block under each field should be independent","venue":null,"work_id":"c3f6ff64-cee0-47b4-8586-1ed634baa10a","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.827514Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:8de711bfc00ef58cb20659d421ff770b9b5eacb9a85ed637f6a0b16781bc3f5f","observation_id":"e799839a-3f33-456d-93ae-86b8d820e280","resolution":{"observed_at":"2026-08-07T12:40:00.825078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:39:55.616900Z","title":"Caia Costello, Simon Guo, Anna Goldie, and Azalia Mirhoseini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.616900Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:3f42a0a8f59f4b8ab2af50530192413ceff4337081b941eb8eb37671fe22fc10","observation_id":"061501b8-bf53-43ab-a118-6973da65e000","resolution":{"observed_at":"2026-08-07T12:39:55.616900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.345478Z","title":"{n} { m}","venue":null,"work_id":"e8ecebaa-fcc6-41de-8203-5ea2943909f0","year":2024},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:59.017463Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:83feba0cbd95675d0b0fe09234b4e010386d722af55eac7db02c4b0c3d4af555","observation_id":"1e236a05-f216-4964-b56f-286e65daac9d","resolution":{"observed_at":"2026-08-07T12:40:00.424892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T12:39:55.896221Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.896221Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:0e8840e2d6e7ac0393849b297dfa6d0d2a19ad49e15763a9c98a77d5ae77e376","observation_id":"2df2e97a-34d1-494c-8141-6e19422bf7fb","resolution":{"observed_at":"2026-08-07T12:39:55.896221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T12:39:56.068560Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.068560Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:ca01890f7253634ee116ca999b546e8da87cc8fb1f2df1f7ac83275846ce0632","observation_id":"e776c6e1-13d8-4fcc-b270-a166d4077ee4","resolution":{"observed_at":"2026-08-07T12:39:56.068560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00752","last_updated":"2025-03-18T19:50:04Z","snapshot_observed_at":"2026-08-04T14:50:34.271833Z","submitted_at":"2024-10-01T14:47:05Z","title":"TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00752","snapshot_observed_at":"2026-08-07T12:39:56.138659Z","title":"Testgeneval: A real world unit test generation and test completion benchmark, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.138659Z"},"links":{"cited_paper":"/paper/2410.00752","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:403f22f487012f85c581845041ddfe83a8077b2bad8692d1417f1f43e0f0e4a5","observation_id":"24efad3f-0eec-4e62-8e7b-b58fb412704c","resolution":{"observed_at":"2026-08-07T12:39:56.138659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T12:39:56.209649Z","title":"Hung Le, Yue Wang, Akhilesh Deepak Gotmare, Silvio Savarese, and Steven Chu Hong Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.209649Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:25e31a519e5cca3a32dd020e0d5f3a8622bbd288a1e583ae8027998fbabc6757","observation_id":"82c7557f-7a31-4555-a1dc-c81aa76c3ac5","resolution":{"observed_at":"2026-08-07T12:39:56.209649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-08-07T12:39:56.557357Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.557357Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:89ca5e629ff75a4050bcac52fe369245222f93a98cf448104eb9a46347c5c2e1","observation_id":"20512dfd-441a-43d1-8ede-44926968ecd0","resolution":{"observed_at":"2026-08-07T12:39:56.557357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05010","last_updated":"2025-02-25T03:17:46Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-10-22T01:58:29Z","title":"Scattered Forest Search: Smarter Code Space Exploration with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05010","snapshot_observed_at":"2026-08-07T12:39:56.669431Z","title":"11 Jiawei Liu and Lingming Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.669431Z"},"links":{"cited_paper":"/paper/2411.05010","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:4b09f87d2ad092eb3185f89d92758c1a24af52c246d890c846da0f7d82fe0827","observation_id":"6bf60f56-81a0-44af-8315-8fc8bfe65d73","resolution":{"observed_at":"2026-08-07T12:39:56.669431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-07T12:39:56.781297Z","title":"Yifei Liu, Li Lyna Zhang, Yi Zhu, Bingcheng Dong, Xudong Zhou, Ning Shang, Fan Yang, and Mao Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.781297Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:8e5bb080b41dea31900ac57c9811513121e6505a937cac10b36a74787950e367","observation_id":"87d06d85-d232-48cf-8b08-7e612b513762","resolution":{"observed_at":"2026-08-07T12:39:56.781297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21297","last_updated":"2025-05-27T15:00:57Z","snapshot_observed_at":"2026-08-07T13:28:17.822753Z","submitted_at":"2025-05-27T15:00:57Z","title":"rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21297","snapshot_observed_at":"2026-08-07T12:39:56.905741Z","title":"Stephan Lukasczyk and Gordon Fraser","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.905741Z"},"links":{"cited_paper":"/paper/2505.21297","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:b6e9314b6da0c945597f94ed283c8aabcf48a8880f34683c8110e9855a3bd29d","observation_id":"4fe2febf-5736-49ce-ae1f-f9eefc4f3563","resolution":{"observed_at":"2026-08-07T12:39:56.905741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:57.037173Z","title":"URL http://dx.doi.org/10.1145/3510454.3516829","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.037173Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:76af85adf77cddd7506a1bcf42f8326b0bd77701020ce29b338df9ffaf445e86","observation_id":"202c5d0d-e4de-49bf-9e6e-a487bf6ee355","resolution":{"observed_at":"2026-08-07T12:39:57.037173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:39:57.197862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.197862Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:4cf28d95d41a40baba6b40c6466654448e3293fab1d320b6a8f202582e672f50","observation_id":"d89f2e36-8c6d-44cb-a848-bf6604ace09f","resolution":{"observed_at":"2026-08-07T12:39:57.197862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-05T15:21:07.825807Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T12:39:57.365862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.365862Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:467dbcbd8a339960e3b7af55cfacbbe654d9aad5680fb8a98d4d3bfd2d534f44","observation_id":"82330be4-dce1-4de6-8fb7-88075f7db129","resolution":{"observed_at":"2026-08-07T12:39:57.365862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02827","last_updated":"2025-02-05T02:08:51Z","snapshot_observed_at":"2026-07-06T20:31:17.809419Z","submitted_at":"2025-02-05T02:08:51Z","title":"COFFE: A Code Efficiency Benchmark for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02827","snapshot_observed_at":"2026-08-07T12:39:57.465250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.465250Z"},"links":{"cited_paper":"/paper/2502.02827","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:12dcbc597846f2d1f34be2c7426a4699a24cd3871ae1060718df26e378f8f0f2","observation_id":"aa34b9b4-ffad-4aa3-83ca-aa3829bb7f6f","resolution":{"observed_at":"2026-08-07T12:39:57.465250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:39:57.560048Z","title":"Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, and Chuan Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.560048Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:9fda2caee1f170d11b81d072f822a77665a69583a7549c13c861af290c414229","observation_id":"ca57237a-acf1-443b-a1e0-ad4fabb214be","resolution":{"observed_at":"2026-08-07T12:39:57.560048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T12:39:57.636759Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.636759Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:e17d7b67dcf10188f4d942de8cb0d2e5cda21fbd20b4bd2d79e8ba4a718ad07d","observation_id":"0d04703e-ce4e-42be-a82d-05ff6f566335","resolution":{"observed_at":"2026-08-07T12:39:57.636759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T12:39:57.721681Z","title":"Testeval: Benchmarking large language models for test case generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.721681Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:ff360ef4958974757e9c0424ddccc8f75e00a362d908366c41a8198b5a4e3b06","observation_id":"9d92569e-dd0a-41c5-9707-ddcccb60ff5d","resolution":{"observed_at":"2026-08-07T12:39:57.721681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-07T12:39:57.824234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.824234Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:dc26c18f396ec02aa5f24fc51a0404ee8b220fa456f08f2b277447608b6d82fa","observation_id":"c61da6a1-b863-4077-b298-007329eaa1e2","resolution":{"observed_at":"2026-08-07T12:39:57.824234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T12:39:57.934398Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.934398Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:3816f64d661a784f466184904d189be4af965e4c01dea33768a0f9901268c0ee","observation_id":"8b65fe22-9ec2-4d7a-b4b4-46c5125f8fd9","resolution":{"observed_at":"2026-08-07T12:39:57.934398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04207","last_updated":"2024-05-19T08:51:14Z","snapshot_observed_at":"2026-08-08T00:08:43.176849Z","submitted_at":"2023-05-07T07:17:08Z","title":"No More Manual Tests? Evaluating and Improving ChatGPT for Unit Test Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04207","snapshot_observed_at":"2026-08-07T12:39:58.040594Z","title":"Eric Zelikman, Yuhuai Wu, Jesse Mu, and Noah Goodman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.040594Z"},"links":{"cited_paper":"/paper/2305.04207","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:789a09a87fb8f949a88c9c5816c0ca689a43fc1a2ba5dffa3cbae4ae4ec04a7a","observation_id":"938c11e9-cd80-453e-88aa-75b304857657","resolution":{"observed_at":"2026-08-07T12:39:58.040594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T12:39:58.116873Z","title":"Acecoder: Acing coder rl via automated test-case synthesis, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.116873Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:663b173d5708de671b763ae69a45be7be9045cf51a87ec08852eff2e0dbe8ab5","observation_id":"ae0285f0-db1e-4107-888c-a8124f293355","resolution":{"observed_at":"2026-08-07T12:39:58.116873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14591","last_updated":"2023-12-08T00:12:58Z","snapshot_observed_at":"2026-08-06T06:52:21.527894Z","submitted_at":"2023-05-24T00:10:15Z","title":"ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle Verifiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14591","snapshot_observed_at":"2026-08-07T12:39:58.211974Z","title":"Quanjun Zhang, Ye Shang, Chunrong Fang, Siqi Gu, Jianyi Zhou, and Zhenyu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.211974Z"},"links":{"cited_paper":"/paper/2305.14591","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:c11a12f99e5d3f78f7bb78ed50a3a216a670f63662155451a5644b10b276a95d","observation_id":"7fe0e6ca-7484-47d1-a1e4-74c89c72c79e","resolution":{"observed_at":"2026-08-07T12:39:58.211974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17561","last_updated":"2024-09-26T06:18:06Z","snapshot_observed_at":"2026-07-06T19:22:32.667859Z","submitted_at":"2024-09-26T06:18:06Z","title":"TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17561","snapshot_observed_at":"2026-08-07T12:39:58.370843Z","title":"Yaowei Zheng, Richong Zhang, Junhao Zhang, Yanhan Ye, Zheyan Luo, Zhangchi Feng, and Yongqiang Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.370843Z"},"links":{"cited_paper":"/paper/2409.17561","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:6ee73357bfefa230955b21fd2a4202324d0925203e6c5bd214e01b3a1d9923ce","observation_id":"05460c55-7a88-42d1-a9f5-469868613ccd","resolution":{"observed_at":"2026-08-07T12:39:58.370843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T12:39:58.472965Z","title":"URL http://arxiv.org/abs/2403.13372","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.472965Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:b84cc02f8597662212aac457ba6ae93bef041a9ef35db6cc067222f1e1b1d1fb","observation_id":"e74403fe-084f-422b-9b8d-5d4808eebf4f","resolution":{"observed_at":"2026-08-07T12:39:58.472965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:01.047186Z","title":null,"venue":null,"work_id":"30a50854-0ed9-4c6f-b318-886ea2fe62d1","year":2025},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.578150Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:5ce46dc60bf42b3940cb331fb2756234feee86fd42cad2ea97a819eda0af693e","observation_id":"5a0d58dc-98f6-4d04-abb3-7da3faa8eed2","resolution":{"observed_at":"2026-08-07T12:40:01.099920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.891434Z","title":"core logic","venue":null,"work_id":"9fc458b8-c03e-4646-bee8-96cf6801701e","year":2023},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.714694Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:cebc2d2ce1aa1d6fdc9dccd023d2778aed48fccc049f41dd5a185470604cb59a","observation_id":"dcfff285-cc90-4ffd-a491-3123e6f4879e","resolution":{"observed_at":"2026-08-07T12:40:00.965186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.539229Z","title":"3\\n1 10\\n2 8\\n3 10","venue":null,"work_id":"f9745b90-9057-4f1d-a982-1383e28e9875","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.905686Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:784103e47fc7da66143cf42ee48da93d7c63eff20074e8e91ae28837f08a204f","observation_id":"d69afd2e-7914-4815-a77d-59fb5b820682","resolution":{"observed_at":"2026-08-07T12:40:00.611877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.691285Z","title":"ISBN 9781450304436","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.691285Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:6c8f8b6ca3c3b733612571626bb73a6e5874acf4d38a633cebf11629e9571706","observation_id":"c47beb24-a9e0-4f8b-8614-f0da8e6c0637","resolution":{"observed_at":"2026-08-07T12:39:55.691285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:39:55.538922Z","title":"Bei Chen, Fengji Zhang, Anh Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.538922Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:21f1974b045ba10479ea4f11498d964b2f5aed69bce708c7ce7d86b6fb03be1c","observation_id":"5115e784-7837-4ed2-986a-be32a29beb91","resolution":{"observed_at":"2026-08-07T12:39:55.538922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-07T12:39:56.321057Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.321057Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:514218eed488873e7728818547ecf31c044db42d96e9b2b21f906dd0abfb3788","observation_id":"5d72edb9-f7f9-44e4-8f82-d98ba46e6223","resolution":{"observed_at":"2026-08-07T12:39:56.321057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-07T18:12:08.883357Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T12:39:56.430228Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.430228Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:d0497288f0836c0854462f4602fc8340a1a9950e4228e1a7ed1d7f06e1bad685","observation_id":"ba80164b-d1a3-4ad6-b274-f52d49fe5572","resolution":{"observed_at":"2026-08-07T12:39:56.430228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02883","last_updated":"2024-12-03T22:38:05Z","snapshot_observed_at":"2026-08-06T20:07:38.885141Z","submitted_at":"2024-12-03T22:38:05Z","title":"TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02883","snapshot_observed_at":"2026-08-07T12:39:55.474805Z","title":"org/abs/2412.02883","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.474805Z"},"links":{"cited_paper":"/paper/2412.02883","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:ecbe9f0ef9e72bbcda17aeabd5705892d200dbe01acbe91562eaab296962f058","observation_id":"f145b96d-c545-4261-bb99-07a16a9a238b","resolution":{"observed_at":"2026-08-07T12:39:55.474805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-08-08T04:08:24.938705Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T12:39:55.391872Z","title":"Toufique Ahmed, Martin Hirzel, Rangeet Pan, Avraham Shinnar, and Saurabh Sinha","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.391872Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:efc110603040c01f94f3ea10b78f71936b22b62122ec639a4728775f07e08a40","observation_id":"51511022-9523-4e30-8b97-5c23997f1d84","resolution":{"observed_at":"2026-08-07T12:39:55.391872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 8 inbound Pith citation observations for arXiv:2505.24098."}