{"as_of":"2026-08-07T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:200fc147b37b1f6176a1ce083d6716635e061214709653ac79f3d200a99284bd","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:57:13.152676Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06980/citation-record","integrity":"/paper/2507.06980/integrity","json":"/paper/2507.06980/citation-record.json","paper":"/paper/2507.06980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.931054Z","title":"https://deepmind","venue":null,"work_id":"19468a04-5de5-459f-9af3-2d40e8b63f1b","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.986869Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:706d59371f7689b81a08d02ae148f39d57a40c437d4479d27de2347fa11163f7","observation_id":"fd190d38-f3f5-40f7-9983-5ec715a5a2e7","resolution":{"observed_at":"2026-08-06T18:57:13.934083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.922021Z","title":"https://platform.openai.com/docs/models/o1/","venue":null,"work_id":"05416c29-0003-40e5-b584-54671aed18f0","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.990649Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:94fd132db30800e6bf2382f0465e8d6596e49569a6bdbb13b34040434b8880e7","observation_id":"e420d59f-78dc-4941-9f59-94a7e5a1999c","resolution":{"observed_at":"2026-08-06T18:57:13.925186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.913459Z","title":"Let the llms talk: Simu- lating human-to-human conversational qa via zero-shot llm-to-llm interactions","venue":null,"work_id":"0a651e36-3646-47cd-af13-3880960f4572","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.994078Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e8c2dde9a99f3f0dab2173068d0b4865686d9fa04a86df4d2538bba6b55ca255","observation_id":"0dd13243-0a6e-4ccb-b74b-5f82f94bdd86","resolution":{"observed_at":"2026-08-06T18:57:13.916708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-07-06T20:50:51.469809Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T18:57:12.997242Z","title":"Chain-of-thought reasoning in the wild is not always faithful","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:12.997242Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:73662106c2944f747d3dd7faa0a54fd4cd83bd31c1869d4cd67ea5c43a6fd2cd","observation_id":"dddb8680-2d31-4975-acb9-d35b4364e831","resolution":{"observed_at":"2026-08-06T18:57:12.997242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.904720Z","title":"Is github’s copilot as bad as humans at introducing vulnerabilities in code? Empirical Software Engineering , 28(6):129, 2023","venue":null,"work_id":"f5099085-ed9f-453b-ac25-3353a0a5d365","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.000811Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:650cae78c490ac6e1f083b0139dca1d14e1e0d1bfd67c7f3df154fd1443c48c3","observation_id":"090910c8-f8c0-45e2-b788-b55841329f11","resolution":{"observed_at":"2026-08-06T18:57:13.908021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T18:57:13.003900Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.003900Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3adb54f84399bcfa0dd0d21c59b27748f4f3b1d88f8fb72a8f0a8552e8b3c8a0","observation_id":"05f384a1-10a6-4683-be98-6259d406079d","resolution":{"observed_at":"2026-08-06T18:57:13.003900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-06T18:57:13.007465Z","title":"Codet: Code generation with generated tests","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.007465Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:fb091ec27626b9a17ad62c7fca5265b69eb9626ae5b3ab7dece5e8cbcbe86587","observation_id":"045be678-fa73-44e7-a757-e3b6f3933bdc","resolution":{"observed_at":"2026-08-06T18:57:13.007465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T18:57:13.010764Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.010764Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:6c3df31127dbe210d93c174f7b635e2617a14442a04daea51c79aadc31455d06","observation_id":"148742a7-2c10-4e69-8977-1e0c1515a2ed","resolution":{"observed_at":"2026-08-06T18:57:13.010764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09089","last_updated":"2025-04-29T14:37:43Z","snapshot_observed_at":"2026-07-31T03:38:00.214207Z","submitted_at":"2025-03-12T05:55:01Z","title":"LocAgent: Graph-Guided LLM Agents for Code Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09089","snapshot_observed_at":"2026-08-06T18:57:13.014157Z","title":"Locagent: Graph- guided llm agents for code localization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.014157Z"},"links":{"cited_paper":"/paper/2503.09089","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:b2c2f8b11c32a7adb879366e387c9cfd15cab5a6dc3a307ec5b8941d4c6e86b3","observation_id":"225d0a00-59af-4c61-91b4-d43e484106a3","resolution":{"observed_at":"2026-08-06T18:57:13.014157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03095","last_updated":"2025-03-31T13:13:27Z","snapshot_observed_at":"2026-07-06T18:57:22.433852Z","submitted_at":"2024-08-06T10:52:41Z","title":"TestART: Improving LLM-based Unit Testing via Co-evolution of Automated Generation and Repair Iteration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03095","snapshot_observed_at":"2026-08-06T18:57:13.017270Z","title":"Testart: Improving llm-based unit test via co-evolution of automated generation and repair iteration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.017270Z"},"links":{"cited_paper":"/paper/2408.03095","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:60d6f193581c9b830b0f6ef0d255af6f1484587f3726561f4750844375f6e918","observation_id":"80cf230c-d9ba-41d1-90f5-b62e0adc921f","resolution":{"observed_at":"2026-08-06T18:57:13.017270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:57:13.020754Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.020754Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:b7c68a7a6087d6763d9f525d72849941bb44e7dc33e56b1145eed31508b169b5","observation_id":"32968c5c-115a-42f3-b597-5eced2799e7b","resolution":{"observed_at":"2026-08-06T18:57:13.020754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T18:57:13.023840Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.023840Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:1f6e03b639fcf6609af73eb1c67b298af27926109bff620c5daa4bb79f52f5a1","observation_id":"9e300668-1bd3-483e-8cd5-14f4e1a3a8cf","resolution":{"observed_at":"2026-08-06T18:57:13.023840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08784","last_updated":"2024-02-23T04:56:37Z","snapshot_observed_at":"2026-08-04T06:36:18.617860Z","submitted_at":"2023-08-17T04:58:51Z","title":"CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08784","snapshot_observed_at":"2026-08-06T18:57:13.026859Z","title":"Codecot: Tackling code syntax errors in cot reason- ing for code generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.026859Z"},"links":{"cited_paper":"/paper/2308.08784","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f3622f18c893af16b8e4aff6b7fadebdf8c86b911b90289049430ef8022ce78f","observation_id":"0051cb81-9ce3-476a-8660-fb9c4255a904","resolution":{"observed_at":"2026-08-06T18:57:13.026859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.896012Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"aa1e643e-35c9-4a1c-aff2-24021744cdb8","year":1991},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.029804Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:5be6bf9486cab4ee08a30b639ea6bb3795a140687ac46dc4131bc7d187d8c62f","observation_id":"ffb95e5f-90fc-4f40-9179-e16ed179174e","resolution":{"observed_at":"2026-08-06T18:57:13.899144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.032645Z","title":"Devanbu, and Emily Morgan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.032645Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:0d213a8c7a2c0134bafde1bc394df333aea42a5fe645c55ba0e8754523f8c63d","observation_id":"ba85e74d-42fd-45f5-948b-472c83fb2b4a","resolution":{"observed_at":"2026-08-06T18:57:13.032645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.887465Z","title":"Self- planning code generation with large language models,","venue":null,"work_id":"98e20a1c-e989-4af6-bbdd-d3e446d467b2","year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.035407Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:29670dc7aaf22871442ba692d45966fafc125d758883ff5d77686334b1f9fb37","observation_id":"9698e8eb-768d-4d64-a7ba-e16e2bd72a79","resolution":{"observed_at":"2026-08-06T18:57:13.890614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-06T18:57:13.041485Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.041485Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e5242e7e1f2b2d03f81bd860920791eb580cfc3002888ed4e18aac54bad52a58","observation_id":"c72dfe49-e09c-4735-9f4c-533e027ca233","resolution":{"observed_at":"2026-08-06T18:57:13.041485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2305.14934","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.490965Z","title":"Grace: Discriminator- guided chain-of-thought reasoning","venue":null,"work_id":"836226e1-7050-4711-bf19-9e0c35e29b8e","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.044893Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d771c878d9dc536da27ae9c4b90af5746637c09cc868380013acf1e869e23e32","observation_id":"d9976e03-e007-4c23-ab53-7cb684635acf","resolution":{"observed_at":"2026-08-06T18:57:13.499467Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.877605Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"6ca5fb8c-518e-4ee6-9cf6-6621c274b24a","year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.047794Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f86bc3d389c303d05e83f2f083c91401f2a237523faaba4737be6ae04daddb81","observation_id":"cc63a596-dd09-4fde-9c68-dca2c4fcba1e","resolution":{"observed_at":"2026-08-06T18:57:13.881690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-06T05:06:31.977572Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-06T18:57:13.050671Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.050671Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:cbf24c5b87ea544f672a3a25774971b1ee2fd474b5e103b2e86f91c06f566e41","observation_id":"c3beeed5-0e39-4cf6-b8c5-fd66db7ff908","resolution":{"observed_at":"2026-08-06T18:57:13.050671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08992","last_updated":"2024-03-14T03:29:09Z","snapshot_observed_at":"2026-08-06T19:54:06.789058Z","submitted_at":"2023-10-13T10:17:48Z","title":"CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08992","snapshot_observed_at":"2026-08-06T18:57:13.053921Z","title":"Codechain: Towards JOURNAL OF LATEX CLASS FILES, VOL","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.053921Z"},"links":{"cited_paper":"/paper/2310.08992","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:1d3c35419f71d33af6cb9cc337333d8a633fa8922fa4c9b7231e9d05f37081b9","observation_id":"65298404-a8eb-4a09-a9d3-95c87983cf7a","resolution":{"observed_at":"2026-08-06T18:57:13.053921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.869292Z","title":"Structured chain-of-thought prompting for code generation","venue":null,"work_id":"2890c64f-3a2d-47e4-88c8-c529fa1babe9","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.056940Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:c7b6a34455a925caa8e1a4f27928458d59c2238b0760b781acf17af971fe67d0","observation_id":"0695e282-24b3-438e-9c2b-e81d33b5cdbe","resolution":{"observed_at":"2026-08-06T18:57:13.872380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04329","last_updated":"2024-11-12T19:37:20Z","snapshot_observed_at":"2026-08-02T04:28:22.816405Z","submitted_at":"2024-11-07T00:09:54Z","title":"CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04329","snapshot_observed_at":"2026-08-06T18:57:13.060665Z","title":"Codetree: Agent-guided tree search for code generation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.060665Z"},"links":{"cited_paper":"/paper/2411.04329","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e39546150d700e9e596e07fd753b264b406d82bbecc982b8e16e1b09154394d5","observation_id":"882c4230-c241-4e77-bd71-ce8f3d35ecb4","resolution":{"observed_at":"2026-08-06T18:57:13.060665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-01T16:20:31.337598Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-06T18:57:13.064699Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.064699Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3e8eb4cbc007a959634d95ed8e29c1d5d3061a9cace69eb3cd163ef253e260fc","observation_id":"19e30428-4e58-4c6d-a4bd-a0a367e5d86d","resolution":{"observed_at":"2026-08-06T18:57:13.064699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.860249Z","title":"Fastfixer: An efficient and effective approach for repair- ing programming assignments","venue":null,"work_id":"1ac82b45-5ca1-4d45-b2a7-589fa7823af9","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.068804Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:c7b6802152b273f3e0398b9480995dfc4346e89044b23fb43d7c3d9461de1870","observation_id":"9bfbd08e-aa7c-45d3-8557-4f96bc069445","resolution":{"observed_at":"2026-08-06T18:57:13.863794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.848834Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":"4cd62b22-52f8-4237-9021-3db6661cb1d1","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.071864Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:7c1e8aa96db5edfcb4e991c0a3dca54b50cb19e4c04a8a2ed07026f7cf38bd63","observation_id":"6c66ca81-1f1b-49cd-8d84-7eaa522da989","resolution":{"observed_at":"2026-08-06T18:57:13.854116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.839707Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"19ff092f-013d-4175-9156-f51f170ae772","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.074817Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3f7c3233fdc2064ef43d6c9b23cc9942ec97a63a75cf79921c5591690d75413c","observation_id":"8e83878d-5eec-411e-9108-24a62f1728de","resolution":{"observed_at":"2026-08-06T18:57:13.843107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.830263Z","title":"Refining chatgpt-generated code: Characterizing and mitigating code quality issues","venue":null,"work_id":"1a4df3e9-3f0d-4c10-a4dc-6582288a969e","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.077529Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e70709e8761da1ce83468aa6b039c0644acb2c164087e1f31c4ccca449b4474a","observation_id":"b52eba2d-4f23-4672-88a9-095b01315893","resolution":{"observed_at":"2026-08-06T18:57:13.834059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04838","last_updated":"2024-04-13T04:58:47Z","snapshot_observed_at":"2026-07-06T16:04:18.544245Z","submitted_at":"2023-08-09T10:01:09Z","title":"No Need to Lift a Finger Anymore? Assessing the Quality of Code Generation by ChatGPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04838","snapshot_observed_at":"2026-08-06T18:57:13.080535Z","title":"No need to lift a finger anymore? assessing the quality of code generation by chatgpt, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.080535Z"},"links":{"cited_paper":"/paper/2308.04838","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:0927d48ab6516ebad0d37cc3a0b4d985705f66fa654051dc824d3bd232221076","observation_id":"1257cabc-3675-4503-869c-657aec8b956a","resolution":{"observed_at":"2026-08-06T18:57:13.080535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10698","last_updated":"2023-10-22T10:21:12Z","snapshot_observed_at":"2026-07-06T16:34:08.044974Z","submitted_at":"2023-10-16T05:09:58Z","title":"Bridging Code Semantic and LLMs: Semantic Chain-of-Thought Prompting for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10698","snapshot_observed_at":"2026-08-06T18:57:13.083644Z","title":"Bridging code semantic and llms: Semantic chain-of- thought prompting for code generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.083644Z"},"links":{"cited_paper":"/paper/2310.10698","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f5ae31265c8aaa373435dc62ed9ab32c782704d07aedcc2d1e15673467023655","observation_id":"799725ee-bf4a-4800-aec3-7672cdaf2d4e","resolution":{"observed_at":"2026-08-06T18:57:13.083644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.086901Z","title":"Clarifygpt: A framework for enhancing llm-based code generation via requirements clarification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.086901Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:7e4b2d1504fa20c272a7320d8afe242d188674f077d852003e236c5a959d7503","observation_id":"625000bc-dd32-486c-9730-b64f0772c4aa","resolution":{"observed_at":"2026-08-06T18:57:13.086901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-06T18:57:13.089866Z","title":"Codegen: An open large language model for code with multi-turn program synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.089866Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:76f4414f21012906e25b45e7c5d823f745b5d7f47967312d4781b87d3fe6ef82","observation_id":"cdb89cb4-0d81-4e13-aba0-cd6f81df5a2b","resolution":{"observed_at":"2026-08-06T18:57:13.089866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-07-31T21:52:59.633187Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-06T18:57:13.092944Z","title":"Mutual reasoning makes smaller llms stronger problem-solvers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.092944Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:06d6b100b51385486fdadf404d95a1d601259a53ec8b6014b6896b86cb80c98e","observation_id":"1ab23470-2b95-42f2-8ac8-d0fe97ba9b41","resolution":{"observed_at":"2026-08-06T18:57:13.092944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T18:57:13.096040Z","title":"Code llama: Open foundation models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.096040Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f6319da40b0574da97bf943bf1b9413a51ab29d43a80599dc2460d5195855e78","observation_id":"dedb6c62-79e1-4381-af05-d974071d4622","resolution":{"observed_at":"2026-08-06T18:57:13.096040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.821179Z","title":"Amazon codewhisperer, 2024","venue":null,"work_id":"5b6bae0f-9421-4fce-9bde-4c8750236f2b","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.099281Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:90628b1bee0c46cbd78f884302e2cf60f85a88aad599d4d5b8a385574765942f","observation_id":"db44968b-3743-45c5-aaa2-7eae9b221c1d","resolution":{"observed_at":"2026-08-06T18:57:13.824385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02047","last_updated":"2024-08-21T01:58:38Z","snapshot_observed_at":"2026-07-06T17:24:45.062473Z","submitted_at":"2024-02-03T05:52:28Z","title":"Calibration and Correctness of Language Models for Code","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02047","snapshot_observed_at":"2026-08-06T18:57:13.102050Z","title":"Quality and trust in llm- generated code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.102050Z"},"links":{"cited_paper":"/paper/2402.02047","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:8231f7dcb8b86b4680f8d3f637adb94a37c5749437ae28205258a227ab396972","observation_id":"74954589-49b8-41f1-8aa4-c9aae5fc6359","resolution":{"observed_at":"2026-08-06T18:57:13.102050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-06T18:57:13.105318Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.105318Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:8f6cca56f2d55e4a055b3d4c226cfe790f9cf7cbc2a32d95b5d7ce2ddf29d3bf","observation_id":"0f73a6b6-88ab-49be-9bff-5e2aa94ad9c6","resolution":{"observed_at":"2026-08-06T18:57:13.105318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08937","last_updated":"2024-03-18T14:34:13Z","snapshot_observed_at":"2026-07-06T17:44:17.232428Z","submitted_at":"2024-03-13T20:12:01Z","title":"Bugs in Large Language Models Generated Code: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08937","snapshot_observed_at":"2026-08-06T18:57:13.108562Z","title":"Desmarais, and Giuliano Antoniol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.108562Z"},"links":{"cited_paper":"/paper/2403.08937","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:e6a05d3df91ee37d935a2e93d96b2b4a3b27d669775674565ae38ed4505ea431","observation_id":"c2cd16ae-52fb-4962-b53a-3e929e395b55","resolution":{"observed_at":"2026-08-06T18:57:13.108562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.812238Z","title":"Code repair with llms gives an exploration-exploitation tradeoff","venue":null,"work_id":"0578eba4-2e98-430b-9bd6-22c244404652","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.111596Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:525d73c5a51baffd61874660bc5fc79d1753f9662f299b827a1788c9b294d2e2","observation_id":"38217dfd-d3c4-471e-8674-c43996863060","resolution":{"observed_at":"2026-08-06T18:57:13.815606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:57:13.114357Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.114357Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:8522ff7a22d2cbb5ef7deb1638d6bfccdf73ad5f5b65ae82109355894b6c1266","observation_id":"742f76d4-a924-4161-b7e2-6746303a1dee","resolution":{"observed_at":"2026-08-06T18:57:13.114357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.117461Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.117461Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:5e3d106aa5a2cd2a29d20ed96acafb707047e35229b4fa65ac3b1a51508f4d35","observation_id":"b6faa49c-bc50-40aa-a7a2-05acbcfa9af2","resolution":{"observed_at":"2026-08-06T18:57:13.117461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.798143Z","title":"Expectation vs","venue":null,"work_id":"2eb293d7-06cc-4c91-848c-b56fde58c0c0","year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.120602Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:f19234255e1f176ee19914c06bbcb9274bfadb6b39517ef8d7838072fa1ada2c","observation_id":"fa0f77b2-7ff5-4ae6-929f-ed9c8c3642ef","resolution":{"observed_at":"2026-08-06T18:57:13.801421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.123452Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.123452Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:765b7a8abd5e28032bf84f250fd76961200cc18fb7fa22f0b69594fc684dc56f","observation_id":"44cb0885-084c-434e-b6cc-0b8d01df9bad","resolution":{"observed_at":"2026-08-06T18:57:13.123452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.783527Z","title":"Using github copilot to solve simple programming problems","venue":null,"work_id":"24c7c3a0-9c78-4114-abc1-c271aba9abf3","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.126255Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:13e6fc28066d1406240a603d5aec06f42ff0d2f10c2666c60c322ccda437a956","observation_id":"b9478c76-6c3f-4f23-b454-ca30fe6e3452","resolution":{"observed_at":"2026-08-06T18:57:13.786801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-06T18:57:13.129076Z","title":"Agentless: Demystifying llm- based software engineering agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.129076Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:3f7096a0c4d33dfcc5254cfb93f567b0462968cd073381be404fc2fcb928bd1b","observation_id":"8ec48f14-0c06-4991-a1aa-9c8606220ce2","resolution":{"observed_at":"2026-08-06T18:57:13.129076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.774585Z","title":"Demystifying llm-based software en- gineering agents","venue":null,"work_id":"dd66ef02-76cb-4a77-ad05-724e2a3fd4ef","year":2025},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.132297Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:b49991ada411efc68e30f197ff661913da45d975787068071834e40d96e71df0","observation_id":"21c5a2ce-f01a-44d3-961e-dbda073ef8af","resolution":{"observed_at":"2026-08-06T18:57:13.777752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.766027Z","title":"Self- evaluation guided beam search for reasoning","venue":null,"work_id":"075a1e18-56ab-4d94-bd6f-71c3dacc3b0e","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.134962Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:87e4cace30e119cb77d075c2f7a44b61d6d33e55ac24d8a8bd05c80d4c6db0e5","observation_id":"189cd40d-6060-4559-9255-5475497315fb","resolution":{"observed_at":"2026-08-06T18:57:13.769096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-06T18:57:13.137811Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.137811Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:1fa0cd09e2b1b2da221db8af83f7b0c545719e15822a101fbe7d46ef4491ccca","observation_id":"6216f725-8dfc-4c42-a584-667df91f637a","resolution":{"observed_at":"2026-08-06T18:57:13.137811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.757151Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"8694c43c-d622-47cf-8b2c-a16668b96326","year":2023},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.140899Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:a6341fc35465294628c3a24667e0753663e21a87d0668366804a4ad1f62d41d9","observation_id":"4486a841-2aad-405e-b4ff-bfb4a2205713","resolution":{"observed_at":"2026-08-06T18:57:13.760345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.748524Z","title":"Framework for evalu- ating code generation ability of large language models","venue":null,"work_id":"6dd677cc-d3c5-459b-aa4a-2b9a47fcce6a","year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.143896Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:c9ddff46f65bf9ae03c327823222e8566cd800a48cc98de21bc889f0c5628a59","observation_id":"0213a368-cc4d-48a4-a603-1554521f1d9c","resolution":{"observed_at":"2026-08-06T18:57:13.751610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03624","last_updated":"2024-08-26T08:09:39Z","snapshot_observed_at":"2026-08-03T08:25:18.092015Z","submitted_at":"2024-07-04T04:19:50Z","title":"Question-Analysis Prompting Improves LLM Performance in Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03624","snapshot_observed_at":"2026-08-06T18:57:13.146831Z","title":"Question-analysis prompting improves llm performance in reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.146831Z"},"links":{"cited_paper":"/paper/2407.03624","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d2e46d621409642098a91ef9ade2aadd239919b797155edb3c69da34280796c2","observation_id":"8dbffacd-d2e2-48b2-93b9-8ecc1bef1d57","resolution":{"observed_at":"2026-08-06T18:57:13.146831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.149843Z","title":"Learning-based widget matching for migrating gui test cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.149843Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:d9c1c484d3ff19e50c5852f8342c19940f6e4197bd83ad1ca61e661e3188ceb0","observation_id":"27c36329-ccc9-4fb1-a4f2-2a3602d51c47","resolution":{"observed_at":"2026-08-06T18:57:13.149843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13227","last_updated":"2023-10-20T02:24:35Z","snapshot_observed_at":"2026-08-07T00:35:09.723451Z","submitted_at":"2023-10-20T02:24:35Z","title":"ToolChain*: Efficient Action Space Navigation in Large Language Models with A* Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13227","snapshot_observed_at":"2026-08-06T18:57:13.152676Z","title":"Toolchain*: Efficient action space navi- gation in large language models with a* search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.152676Z"},"links":{"cited_paper":"/paper/2310.13227","citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:eefb9c57d5b1108bde8afeec15c6b42b4cfe0ccf8b1548c1f3767617aaf14cc5","observation_id":"cd830f19-23cf-4218-b2d1-0d95568360ef","resolution":{"observed_at":"2026-08-06T18:57:13.152676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:13.038475Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:13.038475Z"},"links":{"citing_paper":"/paper/2507.06980"},"observation_digest":"sha256:491653c3abe494dcfa013553e7f4215419c5fb7cebd29756f72661b5a0055316","observation_id":"3998ee99-e134-430a-a740-63a4965287f0","resolution":{"observed_at":"2026-08-06T18:57:13.038475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06980","last_updated":"2025-07-09T16:07:20Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-06T18:47:42.677323Z","submitted_at":"2025-07-09T16:07:20Z","title":"Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.06980."}