{"as_of":"2026-08-08T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6152e2bb7652b8dffb2f8e729017e1cf93b63b288b486cf674ac9a119e18fbf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:26.129442Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:51.646014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:07:15.212042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08806","snapshot_observed_at":"2026-08-07T14:15:51.646014Z","title":"Clover: A test case generation benchmark with coverage, long- context, and verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19443","last_updated":"2025-05-26T03:00:21Z","snapshot_observed_at":"2026-08-07T14:11:48.229560Z","submitted_at":"2025-05-26T03:00:21Z","title":"Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI","version":1},"reference_index":209,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:51.646014Z"},"links":{"cited_paper":"/paper/2502.08806","citing_paper":"/paper/2505.19443"},"observation_digest":"sha256:c84c29874de733924921ad793d220fd48bdbc973e1f5d28e753674c2955d2892","observation_id":"b0f194d3-517d-42d2-b2ed-3996b777a5ec","resolution":{"observed_at":"2026-08-07T14:15:51.646014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"cited_work":{"arxiv_id":"2502.08806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clover: A test case generation benchmark with coverage, long-context, and verification","venue":null,"work_id":"a62ea977-bd75-4bc1-bb3b-d23bab6d7034","year":2025},"citing_paper":{"arxiv_id":"2506.02954","last_updated":"2026-04-15T23:50:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T14:47:22Z","title":"Mutation-Guided Unit Test Generation with a Large Language Model","version":8},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T11:05:15.898419Z"},"links":{"cited_paper":"/paper/2502.08806","citing_paper":"/paper/2506.02954"},"observation_digest":"sha256:7a47cd6c255f2f625e484bec32368694ac7f3bcf6de086c987ade95d5e346693","observation_id":"49ea228e-2a51-4dcc-b708-6a6263debd60","resolution":{"observed_at":"2026-05-19T11:07:15.213581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08806/citation-record","integrity":"/paper/2502.08806/integrity","json":"/paper/2502.08806/citation-record.json","paper":"/paper/2502.08806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.911052Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.911052Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:7bbe1e80fdf5f35a21d56319a6980d20d643da5b188a8c5cf9b0cb2fa9903bdc","observation_id":"72508f8d-9e5d-48d8-a654-45ef9a705f8d","resolution":{"observed_at":"2026-08-07T23:42:25.911052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.878661Z","title":"Meet yi-coder: A small but mighty llm for code, September 2024","venue":null,"work_id":"4bc9f3dd-e591-4b82-8405-88b920349380","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.916747Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:be13961f607322d648f7baa806966a5fdb36c9c312d8b82cf7aff3a7d4b7d078","observation_id":"59a9ffb5-0749-407a-ad4a-cc560e5de77f","resolution":{"observed_at":"2026-08-07T23:42:26.884315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.859878Z","title":"Automated unit test improvement using large language models at meta","venue":null,"work_id":"477db55b-03b8-475e-8af1-02353a5e09ce","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.922104Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:53285becc9e66e41dc91f0296282387602374b515c5b1a9662ab151fc0360689","observation_id":"6e2c432d-aec1-443f-b814-def1994e424a","resolution":{"observed_at":"2026-08-07T23:42:26.865696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T23:42:25.932738Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.932738Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:cd8432f7c4b3435d24c7400207b56286bee6fbe9d1182f4a724b9e8d51dc84e8","observation_id":"5ac23173-e0fc-479c-8440-c21d548a7c5c","resolution":{"observed_at":"2026-08-07T23:42:25.932738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07440","last_updated":"2024-09-11T17:37:48Z","snapshot_observed_at":"2026-07-06T19:13:50.684379Z","submitted_at":"2024-09-11T17:37:48Z","title":"SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07440","snapshot_observed_at":"2026-08-07T23:42:25.937607Z","title":"Super: Evaluating agents on setting up and executing tasks from research repositories, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.937607Z"},"links":{"cited_paper":"/paper/2409.07440","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:33eed57703ab863e90779bf316e729a76c627c02423287a5ece912f0968ef973","observation_id":"a1117347-4f56-4fae-a840-11073f52d909","resolution":{"observed_at":"2026-08-07T23:42:25.937607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T23:42:25.943684Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.943684Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:865d019bf72c9c5f109564f60f6fb2ee54cf5d7264ca38a7c2e9d09be0c4d78d","observation_id":"c727c863-dc46-4ced-8d4b-0a7601781bb1","resolution":{"observed_at":"2026-08-07T23:42:25.943684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.840671Z","title":"Chatunitest: A framework for llm-based test generation","venue":null,"work_id":"0cd7151e-459a-406d-82b2-8682cc028512","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.950223Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:4a79cfa0f1b928a2b4fb70af8dcb17f326c4a785c92063447c480184634833b3","observation_id":"11bf096e-82e7-4a34-82db-eeb1e0729128","resolution":{"observed_at":"2026-08-07T23:42:26.847564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:42:25.955275Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.955275Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:232ad038b5fa8a19b12ac3eaf573abdc44da779590392f6c919745f15e8ea076","observation_id":"0c3a9b8a-0fdf-49f5-ab12-dc7e5a6c356a","resolution":{"observed_at":"2026-08-07T23:42:25.955275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.823901Z","title":"J., Solar-Lezama, A., Synnaeve, G., and Wang, S","venue":null,"work_id":"eb84d770-a473-477b-8fae-2099b992ed45","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.961583Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:d413939add93f6e3b1193b07c497150508a926d97bf3cec5554a56a85e792ba0","observation_id":"f00f1729-beac-4e59-aa60-f4ca89391bea","resolution":{"observed_at":"2026-08-07T23:42:26.829220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T23:42:25.967351Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.967351Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:b4ac24e6b5e36d7b4eb9877d85447ae5732ca164db40c5d5e3261d2c517b4c97","observation_id":"5a0071db-f569-4db8-a768-54b587d05402","resolution":{"observed_at":"2026-08-07T23:42:25.967351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T23:42:25.973919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.973919Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:27b22706aa1d08a65a87c7d00257b7b4dcfdc02b1d2278ecc7c5a5773bcd4037","observation_id":"76019898-5ee3-4a2f-aef5-5a40cd48e651","resolution":{"observed_at":"2026-08-07T23:42:25.973919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00752","last_updated":"2025-03-18T19:50:04Z","snapshot_observed_at":"2026-08-04T14:50:34.271833Z","submitted_at":"2024-10-01T14:47:05Z","title":"TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00752","snapshot_observed_at":"2026-08-07T23:42:25.979207Z","title":"Testgeneval: A real world unit test generation and test completion benchmark, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.979207Z"},"links":{"cited_paper":"/paper/2410.00752","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:f7894bfd35b0a14b324d654aa5ed7ee4c2cd8ad9a776200d3d9f3c3c50d7c62a","observation_id":"8a0d8b4d-4b60-4060-812c-68bf083baa74","resolution":{"observed_at":"2026-08-07T23:42:25.979207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.807437Z","title":"R2e: Turning any github repository into a programming agent environment","venue":null,"work_id":"e57a7f06-7f36-4eb3-aba7-a5abc5f11296","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.983973Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:046c73bf0b1cef4f1e495911ddd7ea35b371e13343a988dec7f23088c874048f","observation_id":"39280e94-d9e8-4317-8c25-95325e37cd88","resolution":{"observed_at":"2026-08-07T23:42:26.812790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:42:25.989171Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.989171Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:69fd769482aa7b8af8bf8ff309b88f50d6d5a4cfb15471afa1e0555d751ead38","observation_id":"3c52b8d0-6faf-4328-8305-9786ea340128","resolution":{"observed_at":"2026-08-07T23:42:25.989171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.993554Z","title":"E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.993554Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:9c06ab14a4dfb53239a1eb989da65a4481ccb08eedcedf7cb1b13084125bc8f6","observation_id":"dab75f0b-a11f-4a61-bcd0-f85002560361","resolution":{"observed_at":"2026-08-07T23:42:25.993554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.997783Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.997783Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:6165e1590cf208d7a20e3e6a565bb28415dd714b1367d6c530917f3cb9931d6f","observation_id":"353b2418-6069-463d-94b7-ad2b24a93276","resolution":{"observed_at":"2026-08-07T23:42:25.997783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-07T20:24:53.074277Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-07T23:42:26.002175Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.002175Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:8d5bb644d607357adf9894c069ecff9a156966a7087d7ecccde23335116c7f36","observation_id":"70e2a6cb-7983-4afc-848a-dce358d2c171","resolution":{"observed_at":"2026-08-07T23:42:26.002175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08604","last_updated":"2024-12-14T09:45:51Z","snapshot_observed_at":"2026-08-06T13:32:36.381010Z","submitted_at":"2024-03-13T15:13:44Z","title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08604","snapshot_observed_at":"2026-08-07T23:42:26.007060Z","title":"Devbench: A comprehensive benchmark for software development, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.007060Z"},"links":{"cited_paper":"/paper/2403.08604","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:b155a4348d85fc8d4bb07fa97c6e272a370e2d16d6971d9e3585ee607cccd958","observation_id":"afbbbc1c-2504-4bd4-a9d0-115285ec925d","resolution":{"observed_at":"2026-08-07T23:42:26.007060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10304","last_updated":"2025-05-31T10:23:39Z","snapshot_observed_at":"2026-07-06T18:00:44.208590Z","submitted_at":"2024-04-16T06:20:06Z","title":"LLM-Powered Test Case Generation for Detecting Bugs in Plausible Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10304","snapshot_observed_at":"2026-08-07T23:42:26.011395Z","title":"M., Han, Y., Ma, Y., Li, G., and Huang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.011395Z"},"links":{"cited_paper":"/paper/2404.10304","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:3ccba2db5307575d0b82132aebd17b3409271ea2ed7d045bb28a352aa349facf","observation_id":"88ed5d32-ead0-458c-bc06-0a49df667072","resolution":{"observed_at":"2026-08-07T23:42:26.011395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.769433Z","title":"Repobench: Benchmarking repository-level code auto-completion systems","venue":null,"work_id":"50e20352-1e80-49af-aa61-c891d04f1b39","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.015960Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:7bca56121737938f71a68592604f88e4e0e9b0083d52d6380d93769848ceadbd","observation_id":"17bfe064-fb3a-4c6e-8e8b-5772ea6976b9","resolution":{"observed_at":"2026-08-07T23:42:26.773987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-07T23:42:26.019897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.019897Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:a12203489d2f44e333a8b4b4abcda0c75ec44db823c41cf213b267179015ef78","observation_id":"c14a6623-d78a-41c4-a5c3-1caf8e0dfdfd","resolution":{"observed_at":"2026-08-07T23:42:26.019897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.752345Z","title":"Repoagent: An llm-powered open-source framework for repository-level code documentation generation, 2024","venue":null,"work_id":"ff04e87c-d4af-4ba0-b363-12e96e4218c5","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.024262Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:26e7d2e174eda6d9afbde3155701ae0d65a1bfae9acf8cbc9a008dd5098bad52","observation_id":"844921b1-14d3-49ed-8aba-144221a67fca","resolution":{"observed_at":"2026-08-07T23:42:26.759143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13521","last_updated":"2024-06-11T15:53:35Z","snapshot_observed_at":"2026-08-07T17:01:32.573966Z","submitted_at":"2024-02-21T04:10:12Z","title":"Test-Driven Development for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13521","snapshot_observed_at":"2026-08-07T23:42:26.028985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.028985Z"},"links":{"cited_paper":"/paper/2402.13521","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:218dbd6aed69a3764b256a3184e119aabab79f270f5f1c125ddef54d56595d67","observation_id":"bd4afb88-4031-41d6-9c6a-e9013809a955","resolution":{"observed_at":"2026-08-07T23:42:26.028985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12952","last_updated":"2025-02-07T12:33:06Z","snapshot_observed_at":"2026-08-04T01:27:27.027017Z","submitted_at":"2024-06-18T14:54:37Z","title":"SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12952","snapshot_observed_at":"2026-08-07T23:42:26.034044Z","title":"N., He, J., and Vechev, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.034044Z"},"links":{"cited_paper":"/paper/2406.12952","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:1119e90c08bbb8a747896fc6ec5dedd5cd9187e7aff4e7dacb641b726f9dfce5","observation_id":"33dee1b0-7eec-4ef4-9ec5-702ca5051ece","resolution":{"observed_at":"2026-08-07T23:42:26.034044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.737520Z","title":"J., Mooney, R","venue":null,"work_id":"d4883c08-34bc-448a-a5fe-2c0085b9263b","year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.039523Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:85a9acd8ab6da90b56d5bc8de9ac412beb29ddbc921e62c57fe22a2612ffd342","observation_id":"dbdf3b35-4b00-4e88-85b2-685875201fdb","resolution":{"observed_at":"2026-08-07T23:42:26.742372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.718932Z","title":"Codegen: An open large language model for code with multi-turn program synthesis","venue":null,"work_id":"1a7b2c21-e8d9-4d66-8a19-0453f137122a","year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.044961Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:33c5a54d81e04bca9ac39e9197632fc697a4b622f8c55e80af751d94c9e9bc83","observation_id":"882590d2-6cf7-40ca-bafd-c35a0fc441bd","resolution":{"observed_at":"2026-08-07T23:42:26.724156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T23:42:26.050031Z","title":"E., Adi, Y., Liu, J., Sauvestre, R., Remez, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.050031Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:fc989e37667b11c135c0e6c48619999764c15375761a31cc290f5742ccd87f3a","observation_id":"2855f320-9c19-4666-899b-9579be09bdb7","resolution":{"observed_at":"2026-08-07T23:42:26.050031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.703007Z","title":"K., and Ray, B","venue":null,"work_id":"516b29d0-101d-497a-a01f-aa61d76b1a2d","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.054881Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:aee256791e46a3966dd9441ae1ca8935c357da472b33016b6073cec92391acaa","observation_id":"3afee8b9-c755-4011-a584-e938b40a1248","resolution":{"observed_at":"2026-08-07T23:42:26.707580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.687465Z","title":"Chatgpt vs sbst: A comparative assessment of unit test suite generation","venue":null,"work_id":"6176dead-e964-4fff-ab7a-34e41ea8f2e9","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.059574Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:829b7cc72022c90614ce24826157b17599232450de8556030155b80d0a464b05","observation_id":"e6370a87-6d6d-4315-8da3-7b759ed4a708","resolution":{"observed_at":"2026-08-07T23:42:26.692563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11409","last_updated":"2024-06-19T02:37:50Z","snapshot_observed_at":"2026-08-06T23:06:20.949657Z","submitted_at":"2024-06-17T10:54:35Z","title":"CodeGemma: Open Code Models Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11409","snapshot_observed_at":"2026-08-07T23:42:26.063958Z","title":"A., Shen, J., Kelley, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.063958Z"},"links":{"cited_paper":"/paper/2406.11409","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:3c7a0e8ca61e2bdb495c6a31059f47efacede005a8e13cc59511b13c383f9ba2","observation_id":"6c7198a6-20a1-4406-87a8-71f4ebb5d688","resolution":{"observed_at":"2026-08-07T23:42:26.063958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.05617","last_updated":"2021-05-20T23:11:01Z","snapshot_observed_at":"2026-07-06T09:54:57.110238Z","submitted_at":"2020-09-11T18:57:36Z","title":"Unit Test Case Generation with Transformers and Focal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.05617","snapshot_observed_at":"2026-08-07T23:42:26.068366Z","title":"K., and Sundaresan, N","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.068366Z"},"links":{"cited_paper":"/paper/2009.05617","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:cc24f17e64e6da4d86a9f001358f3663448186d715492f1c3656f1cbc51dcd4f","observation_id":"ebb79ddf-1a70-418f-9f57-6128893ddb9f","resolution":{"observed_at":"2026-08-07T23:42:26.068366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.671808Z","title":"Software testing with large language models: Survey, landscape, and vision","venue":null,"work_id":"34444e1d-3942-4b6c-aa81-41132dfadcb2","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.073028Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:ed6437848b40885f85819497627074667460b7dcb963b6f7a2394d3ce6ed73ba","observation_id":"22702a80-367a-4b74-b60f-c6a8486d71e1","resolution":{"observed_at":"2026-08-07T23:42:26.676989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T23:42:26.077466Z","title":"R., and Ma, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.077466Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:0a151d205346a8f16ace2302e43ff6c42703eda41ecdf334299c3a87f399b3c6","observation_id":"a243c40a-07ad-4554-8a41-896446ed20d4","resolution":{"observed_at":"2026-08-07T23:42:26.077466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-07T23:42:26.082368Z","title":"F., Tang, X., Zhuge, M., Pan, J., Song, Y., Li, B., Singh, J., Tran, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.082368Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:9bff32cc9629fb2d5135a317556c00bacef2e1261e0a18d260bd1feee4350ab8","observation_id":"fd712e2f-d0d7-419b-aa5f-e44a6811fb86","resolution":{"observed_at":"2026-08-07T23:42:26.082368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.652680Z","title":"Magicoder: Empowering code generation with OSS -instruct","venue":null,"work_id":"69720e05-1eaa-46ab-b7d0-43ad56b29624","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.086937Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:f475577e04295158349a87082fcbc09b0726e287cd926e0d73961b37c6d67567","observation_id":"291a2922-1a84-4014-aa9b-5c207b23db5a","resolution":{"observed_at":"2026-08-07T23:42:26.659141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T23:42:26.091037Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.091037Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:bfb4a27c3fe892ace0ecf1a722d713530614a6025521d28b1a1854d561200f96","observation_id":"f5a13ddf-4d83-4ce3-ae3d-4f07f7413dfb","resolution":{"observed_at":"2026-08-07T23:42:26.091037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.633880Z","title":"and Liang, P","venue":null,"work_id":"76039859-39e5-443d-a4df-93ee37191206","year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.095510Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:7e9cfc22b3b8ffde63e1a22805d66b6cc79dc1f7d841084da6a0998a006a9434","observation_id":"cb309eb7-bd23-453e-81f5-4cad2b614138","resolution":{"observed_at":"2026-08-07T23:42:26.639126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.615884Z","title":"and Harman, M","venue":null,"work_id":"ea0c52bc-fbdc-4d1c-89f6-a78acf3ebc12","year":2012},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.099608Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:5f59ca0c036ecaf7e0b44a85b904a28222f35e096ed1c135aba012ab65746cd3","observation_id":"8ba92b89-6781-4cb0-b05b-f5aedd330860","resolution":{"observed_at":"2026-08-07T23:42:26.621538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.597988Z","title":"Evaluating and improving chatgpt for unit test generation","venue":null,"work_id":"4aad696a-ac95-4c2e-9466-f7d0c54b173f","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.103527Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:8165cf262cbe23b88292562743bebfa9cde40ab68c5fe85609da87f4757fcc24","observation_id":"28b3986c-117e-4fb5-abf9-4b6ac14657d1","resolution":{"observed_at":"2026-08-07T23:42:26.603549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17561","last_updated":"2024-09-26T06:18:06Z","snapshot_observed_at":"2026-07-06T19:22:32.667859Z","submitted_at":"2024-09-26T06:18:06Z","title":"TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17561","snapshot_observed_at":"2026-08-07T23:42:26.107547Z","title":"Testbench: Evaluating class-level test case generation capability of large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.107547Z"},"links":{"cited_paper":"/paper/2409.17561","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:2e8c11244313a5659d393d345e869c19f1610eb42399cde070d424e971918d3a","observation_id":"8be7cd65-24b6-47a7-ae15-563f1939239d","resolution":{"observed_at":"2026-08-07T23:42:26.107547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.578887Z","title":"B ench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":"a12ffbfd-db50-45b9-a8a4-32bd812a3d76","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.111985Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:63ffcc10ba423583805e370d16eb5a30cb05a8ae226d8878b3e4035c47555a49","observation_id":"dd257b3b-4bc3-4ffc-a66b-1c549c8f179a","resolution":{"observed_at":"2026-08-07T23:42:26.587274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.563197Z","title":"Y., Vu, M","venue":null,"work_id":"9e7b4800-596d-4b2f-a9f4-8d1a6125306d","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.116342Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:8b157cbbbdc35cc06d2c761b8b5d9189e7f7bcf7179f8cea9ef08d766bf2b78e","observation_id":"8e74ffd1-4237-4dca-98df-9a1838e9e116","resolution":{"observed_at":"2026-08-07T23:42:26.567859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.120518Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.120518Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:af2ea064776f5f7df0cc60e14386890ab4ff619784a69ffed8b41e8db8e2e6ec","observation_id":"bb4fa065-3de2-4d8d-a73b-422b961060e2","resolution":{"observed_at":"2026-08-07T23:42:26.120518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.125205Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.125205Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:4ae33747d041808a7323c74392aacc879b36f1d97a0fc7d02ea30030139c767a","observation_id":"980300f9-2a1c-41c7-a2b8-410545e523b8","resolution":{"observed_at":"2026-08-07T23:42:26.125205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.522833Z","title":"a\") == \"a","venue":null,"work_id":"d02c8963-dea1-4daf-9371-54c61f984f56","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.129442Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:48215017db37242c4b1f6f1c19c1517620576cf35479725d69bc36101cff02e2","observation_id":"829199ae-e796-4229-a703-89a0d9b1c398","resolution":{"observed_at":"2026-08-07T23:42:26.529291Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T23:35:10.429545Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2502.08806."}