{"as_of":"2026-08-07T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cbaf6595bde235114f94a48309a7f074dd1f8af1f65cd418d671696b8d588df1","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:16:42.794738Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:17:10.481202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:9075e5ae30ba4f240ef496daadf1a1cb89a0e16fb7bb0c3ccf4b5d1a474c7a4f","observation_id":"39c86638-d467-4dad-9eba-bfbb7c127715","resolution":{"observed_at":"2026-05-11T17:21:11.028874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2605.30219","last_updated":"2026-05-28T16:52:04Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T16:52:04Z","title":"When Should Models Change Their Minds? Contextual Belief Management in Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T07:17:07.720589Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2605.30219"},"observation_digest":"sha256:236e5a34cd29f64eab27257b0144f6013bb70c4ef718035e1ccbb84596571391","observation_id":"290c59ff-805d-4373-ba60-59b11e8a9b3e","resolution":{"observed_at":"2026-06-29T07:23:12.976976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.07539","last_updated":"2026-04-29T17:39:36Z","snapshot_observed_at":"2026-08-02T12:30:34.186010Z","submitted_at":"2026-04-29T17:39:36Z","title":"Prompt Governance? On Governing Technologies Governed by Natural Language","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-01T08:17:10.481202Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.07539"},"observation_digest":"sha256:d6dfd2a3d7b9fcdbe2a61328d45380833a14d956c3c4950de4f0e83bff77d678","observation_id":"57e95625-d60e-4a7b-a963-890c4f78eb3d","resolution":{"observed_at":"2026-07-01T08:25:32.385646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.25747","last_updated":"2026-06-30T12:52:08Z","snapshot_observed_at":"2026-08-02T12:27:31.060186Z","submitted_at":"2026-06-24T12:16:04Z","title":"CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T20:22:29.287534Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.25747"},"observation_digest":"sha256:91d5eed49ad64a2f53a64e8a2487087daea8bd70e402979f5537c520009ba517","observation_id":"c805b868-143f-4aaf-89c6-f46868efae58","resolution":{"observed_at":"2026-07-04T20:20:06.984330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"cited_work":{"arxiv_id":"2507.00699","doi":"10.48550/arxiv.2507.00699","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":"ArXiv.org","work_id":"b83bc13e-faba-4a19-976d-bc6f0e36e264","year":2025},"citing_paper":{"arxiv_id":"2606.25747","last_updated":"2026-06-30T12:52:08Z","snapshot_observed_at":"2026-08-02T12:27:31.060186Z","submitted_at":"2026-06-24T12:16:04Z","title":"CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:05:50.811872Z"},"links":{"cited_paper":"/paper/2507.00699","citing_paper":"/paper/2606.25747"},"observation_digest":"sha256:d244aeb9e8016d868343320b5402a13d2d1302948cc07882bd018734a1e36934","observation_id":"9f50b92b-d06f-40a4-a0b3-2d24dcfef8ae","resolution":{"observed_at":"2026-07-01T08:55:35.347673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00699/citation-record","integrity":"/paper/2507.00699/integrity","json":"/paper/2507.00699/citation-record.json","paper":"/paper/2507.00699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:40.649612Z","title":"Soen-101: Code generation by emulating software process models using large language model agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.649612Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:9c992a2dc72f95e1e47d10453f4244c5d0a3b9beda3922e652b27f8c44a9e184","observation_id":"98959035-344d-4dd5-b524-8cc2a7ddf776","resolution":{"observed_at":"2026-08-06T21:16:40.649612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07112","last_updated":"2025-03-22T13:56:52Z","snapshot_observed_at":"2026-07-31T05:57:18.855117Z","submitted_at":"2024-11-11T16:39:13Z","title":"ROCODE: Integrating Backtracking Mechanism and Program Analysis in Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07112","snapshot_observed_at":"2026-08-06T21:16:40.840152Z","title":"Rocode: Integrating backtracking mechanism and program analysis in large language models for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.840152Z"},"links":{"cited_paper":"/paper/2411.07112","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:7503eddc3746efbf632700dd450b5c4473b965cc972814d69979a0915e19a6fb","observation_id":"d930fc1b-9079-4376-9294-e8d94752079b","resolution":{"observed_at":"2026-08-06T21:16:40.840152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:40.912600Z","title":"Skcoder: A sketch-based approach for automatic code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.912600Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:3f24548dd1cc1bc08bd3902a606a37ca6062931e6cbc30f557854012e757565d","observation_id":"815bdd69-f192-49d1-a45f-c0730df2b1fd","resolution":{"observed_at":"2026-08-06T21:16:40.912600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07768","last_updated":"2025-05-12T17:20:30Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:20:30Z","title":"Enhancing Code Generation via Bidirectional Comment-Level Mutual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07768","snapshot_observed_at":"2026-08-06T21:16:40.926501Z","title":"Enhancing code generation via bidirectional comment-level mutual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.926501Z"},"links":{"cited_paper":"/paper/2505.07768","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:3260900bb62a40fdee3d146a4c29b98eb3066ed7de8146e0018d26e04ee74c10","observation_id":"05f51ad5-7b73-48d2-af70-60563fdb60ed","resolution":{"observed_at":"2026-08-06T21:16:40.926501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16120","last_updated":"2024-12-19T05:18:33Z","snapshot_observed_at":"2026-07-06T16:24:42.336000Z","submitted_at":"2023-09-28T02:58:07Z","title":"Fixing Large Language Models' Specification Misunderstanding for Better Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16120","snapshot_observed_at":"2026-08-06T21:16:41.068895Z","title":"Fixing large language models’ specification misunderstanding for better code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.068895Z"},"links":{"cited_paper":"/paper/2309.16120","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:39cfd41f65fa423137ad9e0a539a08fe4bcbdb480c7ba28410f54503cc2ef1d2","observation_id":"e0d3c8c6-b55a-49ef-ad5e-effa4a22987b","resolution":{"observed_at":"2026-08-06T21:16:41.068895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T21:16:41.283330Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.283330Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:96af4d9d53096eda628d9a0fd297cc06124c3d2cbb798df15861e4ac6b4fcc55","observation_id":"b61f1b99-39fe-4665-b59b-aa73c79502a7","resolution":{"observed_at":"2026-08-06T21:16:41.283330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T21:16:41.360449Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.360449Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:30151f36da594a1d3401d57d1d18137c2dd56a885ca266139d2bcb4e4ae735f0","observation_id":"b47c095f-2342-44b3-9824-95727e3a39bc","resolution":{"observed_at":"2026-08-06T21:16:41.360449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16498","last_updated":"2025-03-04T09:13:23Z","snapshot_observed_at":"2026-08-02T17:19:49.137620Z","submitted_at":"2024-08-29T12:56:06Z","title":"A Survey on Evaluating Large Language Models in Code Generation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16498","snapshot_observed_at":"2026-08-06T21:16:41.365515Z","title":"A survey on evaluating large language models in code generation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.365515Z"},"links":{"cited_paper":"/paper/2408.16498","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:008bfd4dd7a3d18cb2730793dd438f3858255e1a568c271f5a9c01cc3e3e8f9d","observation_id":"3bc9bdaa-f0df-4836-91cb-e64f7b267922","resolution":{"observed_at":"2026-08-06T21:16:41.365515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:41.453046Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.453046Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:6b29c509b96c4bb397dd2d27366f9419a7fdf869d820beb0a8e44bc2e1be0be8","observation_id":"43c39c9e-b5aa-4659-bec4-0e0753fedd37","resolution":{"observed_at":"2026-08-06T21:16:41.453046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-07T08:24:45.140295Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-06T21:16:41.489193Z","title":"Infobench: Evaluating instruction following ability in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.489193Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:fa3ae068276fdb83ba30f093bb9afb74ee1b2f21faede8fd1b41f2b95a422d66","observation_id":"da751ba6-c1d1-47df-985f-5a1f713dda1c","resolution":{"observed_at":"2026-08-06T21:16:41.489193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19166","last_updated":"2025-08-04T07:46:55Z","snapshot_observed_at":"2026-08-04T11:25:34.507461Z","submitted_at":"2025-02-26T14:19:49Z","title":"CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19166","snapshot_observed_at":"2026-08-06T21:16:41.524744Z","title":"Codeif: Benchmarking the instruction-following capabilities of large language models for code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.524744Z"},"links":{"cited_paper":"/paper/2502.19166","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:37314bd816cd41a44396b88469c51102ba33cbc5a3ade0641498b9d5f8137cf1","observation_id":"f1774027-b0c4-4f17-81a5-df9a12cc59c7","resolution":{"observed_at":"2026-08-06T21:16:41.524744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:41.559939Z","title":"Codeif-bench: Evaluating instruction-following capabilities of large language models in interactive code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.559939Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:e9d0adc19fe3777df018ebedb27dbe3664010191441507ca292edf003ff62328","observation_id":"1193c980-a560-4bd8-85e2-898adf58dbbe","resolution":{"observed_at":"2026-08-06T21:16:41.559939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:48.018339Z","title":"A hierarchical and evolvable benchmark for fine-grained code instruction following with multi-turn feedback,","venue":null,"work_id":"aef8163a-df81-4a2c-a105-6ee7f5bd83f7","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.648086Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:eaebc9489626a1fa32ce6b8041be8df32fd1c2c27556ebd551879c027bcbad1a","observation_id":"79701b5d-baf1-4604-9754-541bf883a75a","resolution":{"observed_at":"2026-08-06T21:16:48.065482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00456","last_updated":"2025-06-21T17:44:03Z","snapshot_observed_at":"2026-07-06T18:38:54.776114Z","submitted_at":"2024-06-29T14:56:11Z","title":"Beyond Functional Correctness: Investigating Coding Style Inconsistencies in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00456","snapshot_observed_at":"2026-08-06T21:16:41.671896Z","title":"Beyond functional correctness: Investigating coding style inconsistencies in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.671896Z"},"links":{"cited_paper":"/paper/2407.00456","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:5a376b32768df1911e7d39b331799fedf6e088f72e44f76da723827963cf8df9","observation_id":"ea3e0791-063d-489c-a370-71143a52ca3b","resolution":{"observed_at":"2026-08-06T21:16:41.671896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-07-06T16:41:07.373710Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-06T21:16:41.694748Z","title":"Followbench: A multi-level fine- grained constraints following benchmark for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.694748Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:cd5e8494227de0470641b9bda749f9b47ea2e9071edcfe6db3cc82918ecc505b","observation_id":"cea143ab-1230-4175-9893-9bb48f9b74f8","resolution":{"observed_at":"2026-08-06T21:16:41.694748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.835046Z","title":"Sharegpt,","venue":null,"work_id":"77820d1c-2606-41f8-a270-0bdf9a2c65ad","year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.734747Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:507a7e48add90071323ad279fa2721d4d036da4e414bcc5ed2496c67f1dcde8e","observation_id":"bb171d85-fe5a-43b1-837c-f0361ca7f398","resolution":{"observed_at":"2026-08-06T21:16:47.895647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17176","last_updated":"2025-05-04T13:32:32Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-24T08:15:05Z","title":"Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant","version":3},"cited_work":{"arxiv_id":"2501.17176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17176","snapshot_observed_at":"2026-08-06T21:16:45.447354Z","title":"Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant","venue":"cs.CY","work_id":"b5d90f2c-2d4d-49f3-9499-80506da5d0ea","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.784746Z"},"links":{"cited_paper":"/paper/2501.17176","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:9c8488556d61f582d5ee011cab8b47bdb7000a0db123efe1de45816d8b3d0387","observation_id":"f6eabef0-6a5c-4206-bbcc-a25731a628f8","resolution":{"observed_at":"2026-08-06T21:16:45.463009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.15531772","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:43.075030Z","title":"tree-sitter/tree-sitter: v0.25.5,","venue":null,"work_id":"0446a91e-867d-4e27-9c03-34f38f6bdeb4","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.819239Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:e18751ce8349f10f56b33b1084ab3433eabe17a7c3d8e6a3c632aee7c540d2a7","observation_id":"1e647956-e148-494d-8d08-dc3e467a846e","resolution":{"observed_at":"2026-08-06T21:16:43.134792Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:16:41.874749Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.874749Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:fc89e038fc3dacc4d6ea5e2936f7bb3a8c3cb355b96ae1e9f3478f734ba1897f","observation_id":"a19eca15-2d4a-4f3a-9595-400190df6f7e","resolution":{"observed_at":"2026-08-06T21:16:41.874749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.424766Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"b3cd3655-397f-4746-8ecb-9e20dbb6a8b8","year":2004},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.914739Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:a21aee722b4434ffdaf2755eee6547f866dbe5fe7a7bd062abc091c12b139216","observation_id":"e6c825af-d137-4486-9936-ea7107ce2302","resolution":{"observed_at":"2026-08-06T21:16:47.604770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:16:41.937129Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.937129Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:51d469812da2b22498503f5e390d22eb1f691cb73d4ea25de58e454f88f5f486","observation_id":"5a0c9c0b-bf7f-4272-9ae4-e7c2665ef132","resolution":{"observed_at":"2026-08-06T21:16:41.937129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:47.010788Z","title":"Claude 3.7 sonnet and claude code,","venue":null,"work_id":"ae18f9a0-7df4-4a76-a8cd-7ff6d8cce9da","year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.963659Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:59957a8fbc3ca87d90230489bfac926acd98fce787ab94f7fc8254d6547c3aad","observation_id":"26e3e459-d30c-460a-a7ed-295320b0c912","resolution":{"observed_at":"2026-08-06T21:16:47.186490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:16:41.994749Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.994749Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:6fb927c6a544ec5ab915e07f37fc92086757e2d5a9802076745076d9f300dfc8","observation_id":"84baed67-510b-43ca-b183-a206c5ce0c6f","resolution":{"observed_at":"2026-08-06T21:16:41.994749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:16:42.034748Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.034748Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:01368a791f58409c648c1a644d79b95b601c9d23b804ee89d5a62de923a7a212","observation_id":"8abd2f57-2fd9-40f2-8480-f908485b89dd","resolution":{"observed_at":"2026-08-06T21:16:42.034748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T21:16:42.094905Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.094905Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:0a13a0a3d12e0d45ebe37bf057d6bea12d176012115071945b4021eca92ede10","observation_id":"7a297632-837c-4105-8ad7-12f0e53f9b6d","resolution":{"observed_at":"2026-08-06T21:16:42.094905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:16:42.134745Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.134745Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:7938c31f0370a706d63613a3d2365639a291d3d1b376c5386825b0ad6042cd2d","observation_id":"1927e71d-37ba-4f26-8e8d-3d54415b000e","resolution":{"observed_at":"2026-08-06T21:16:42.134745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.174750Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.174750Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:6bf59a7f2097c6031590b0230622bdbdbde78dda7c06efc12d25cc16d02bc0c6","observation_id":"37067ce1-3533-4b5b-ac4f-c3abc6105d35","resolution":{"observed_at":"2026-08-06T21:16:42.174750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.675249Z","title":"Guesslang: A neural network to guess the programming language from code snippet,","venue":null,"work_id":"950aa49c-0788-45a7-b8c7-b05bf3ba5f07","year":2019},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.225023Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:aae59b1a615e48ab5edd41e7e2f709dc08874e2076ae57676233fd51588c7a11","observation_id":"984bcaa4-5042-4ed1-8926-f2ea96675d1d","resolution":{"observed_at":"2026-08-06T21:16:46.819549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-06T17:51:02.914236Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-06T21:16:42.274834Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.274834Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:9e150136b4c4f75f89edb2999f3d05bdb0977bf731d6dd75f3cbffd1a8a8a5ca","observation_id":"154ca5db-694d-4241-b4e1-f0df76995d2e","resolution":{"observed_at":"2026-08-06T21:16:42.274834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01861","last_updated":"2023-08-14T09:07:00Z","snapshot_observed_at":"2026-08-03T22:16:12.497107Z","submitted_at":"2023-08-03T16:31:02Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01861","snapshot_observed_at":"2026-08-06T21:16:42.308763Z","title":"Classeval: A manually-crafted benchmark for evaluating llms on class-level code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.308763Z"},"links":{"cited_paper":"/paper/2308.01861","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:f4ac2a9eebf35f86f25c7a6a5d127fb08948f2b7f1d1c77b74603c651e9a7eeb","observation_id":"a938fd60-4e67-407d-864f-5b65fe7c3f08","resolution":{"observed_at":"2026-08-06T21:16:42.308763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.314114Z","title":"Learning-based widget matching for migrating gui test cases,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.314114Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:e0c67b7211c65fc9cf6e1292f40688f1e14a24420f3a06cfcd098949a5dba795","observation_id":"72cdc08a-3578-47b8-8024-0aced3a8923c","resolution":{"observed_at":"2026-08-06T21:16:42.314114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19856","last_updated":"2024-05-30T09:03:42Z","snapshot_observed_at":"2026-07-06T18:22:31.384923Z","submitted_at":"2024-05-30T09:03:42Z","title":"DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19856","snapshot_observed_at":"2026-08-06T21:16:42.331104Z","title":"Deveval: A manually-annotated code generation benchmark aligned with real-world code repositories,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.331104Z"},"links":{"cited_paper":"/paper/2405.19856","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:fdc4a23e4c2a3e052030054afcdb2e0b9105e9cb1e99fd87c4bdfdd2da4b32c2","observation_id":"e6008267-b874-4237-a2fc-97efca23c204","resolution":{"observed_at":"2026-08-06T21:16:42.331104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16922","last_updated":"2025-03-21T07:33:59Z","snapshot_observed_at":"2026-07-06T20:56:31.841348Z","submitted_at":"2025-03-21T07:33:59Z","title":"RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16922","snapshot_observed_at":"2026-08-06T21:16:42.334629Z","title":"Rustevoˆ 2: An evolving benchmark for api evolution in llm-based rust code generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.334629Z"},"links":{"cited_paper":"/paper/2503.16922","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:d537845a3176750c5cedbcdaf013c613958dd361003688051ea7d6e3b3087f8b","observation_id":"459eb448-1417-48ee-bb16-61b7931bcb71","resolution":{"observed_at":"2026-08-06T21:16:42.334629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.374745Z","title":"Feedbackeval: A benchmark for evaluating large language models in feedback-driven code repair tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.374745Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:bca45337911be9aceea415ba46c2bfe60ea7d6f8b08a580e004ebeadbb10c3fb","observation_id":"b0b49b14-e3ac-4ed8-9abc-f6418ac8b6db","resolution":{"observed_at":"2026-08-06T21:16:42.374745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.629301Z","title":"Benchmarking complex instruction-following with multiple constraints composition,","venue":null,"work_id":"239fb0ac-b5da-4fd6-9dab-40f1e46edbde","year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.424811Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:283c68dab35d1af79b3ee1b6095a2e141d71dda872edebc265af1c92d05552f6","observation_id":"a95a8c12-ebd9-42f2-bcf9-72e7ba49ac5e","resolution":{"observed_at":"2026-08-06T21:16:46.644479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03351","last_updated":"2024-10-04T12:17:08Z","snapshot_observed_at":"2026-07-06T19:27:37.936219Z","submitted_at":"2024-10-04T12:17:08Z","title":"Generating Equivalent Representations of Code By A Self-Reflection Approach","version":1},"cited_work":{"arxiv_id":"2410.03351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03351","snapshot_observed_at":"2026-08-06T21:16:43.965719Z","title":"Generating Equivalent Representations of Code By A Self-Reflection Approach","venue":"cs.CL","work_id":"b3d39bd7-0e25-4794-9495-56819a7544f4","year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.503377Z"},"links":{"cited_paper":"/paper/2410.03351","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:f48d910327acfb2315a6d8aee2e73742822d28879fd6d804ecb24d255625e6a0","observation_id":"472da2bc-29fc-4846-9f68-71cf6927d5ff","resolution":{"observed_at":"2026-08-06T21:16:44.004826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:42.546851Z","title":"Codescore: Evaluating code generation by learning code execution,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.546851Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:7d81733bf4011939bbdd0ed68909664825d37f19648a256b2409d347d3b1311e","observation_id":"674a015e-81df-4cc0-8811-24c3c0e410d4","resolution":{"observed_at":"2026-08-06T21:16:42.546851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03978","last_updated":"2024-10-31T08:11:04Z","snapshot_observed_at":"2026-07-06T18:41:35.995594Z","submitted_at":"2024-07-04T14:50:45Z","title":"Benchmarking Complex Instruction-Following with Multiple Constraints Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03978","snapshot_observed_at":"2026-08-06T21:16:42.464751Z","title":"Available: https://arxiv.org/abs/2407.03978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.464751Z"},"links":{"cited_paper":"/paper/2407.03978","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:1a6b2c00188edc680d8cd893bdb55cfdcb2aee753e87d369b411f2f7e4aa7774","observation_id":"d0639506-78c1-4147-a23d-9a7d2faeb7e1","resolution":{"observed_at":"2026-08-06T21:16:42.464751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T21:16:42.626496Z","title":"Wizardlm: Empowering large pre-trained language models to follow complex instructions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.626496Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:198bf6c954dcd831c4a594ed58baf187a53515efca852c2f8019f28eba9d4636","observation_id":"40aa013e-3916-4b50-84d9-62400e7e56f0","resolution":{"observed_at":"2026-08-06T21:16:42.626496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-08-06T21:16:42.654739Z","title":"Magicoder: Empowering code generation with oss-instruct,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.654739Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:c76204cc2cb7c29b0d31d69c113f914e80c3c3aadb859977f4fe33b1a69dd002","observation_id":"ca44739c-0b3f-4e91-aadd-61e8e4bc0971","resolution":{"observed_at":"2026-08-06T21:16:42.654739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-06T21:16:42.591153Z","title":"Self-instruct: Aligning language models with self-generated instructions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.591153Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:8bedcb038ecabac4aa1b12b14253fbd564d747fd390cb14a15a4b4505f836f0c","observation_id":"7d317827-9bbe-47f6-a99c-de1dfb3fb9b5","resolution":{"observed_at":"2026-08-06T21:16:42.591153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:46.594470Z","title":"Genetic instruct: Scaling up synthetic generation of coding instructions for large language models,","venue":null,"work_id":"c87eae8f-b76e-4f85-94af-fd8eea76c894","year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.750003Z"},"links":{"citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:f897178625d9e833e227916d7be5a18635c67f3bf4a4563267cfe629de23f221","observation_id":"57834f6e-a9ec-4a0c-8657-fbc15a330194","resolution":{"observed_at":"2026-08-06T21:16:46.608394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14187","last_updated":"2024-06-07T07:46:28Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-20T09:02:29Z","title":"WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14187","snapshot_observed_at":"2026-08-06T21:16:42.694742Z","title":"Wavecoder: Widespread and versatile enhancement for code large language models by instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.694742Z"},"links":{"cited_paper":"/paper/2312.14187","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:f9811fd4b17c07ecdd7fb73594cf085e9a637b563be75ce938017d5599ee2f4e","observation_id":"9b693b4d-0478-4898-8651-a21d4f48dba9","resolution":{"observed_at":"2026-08-06T21:16:42.694742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-06T21:16:41.484523Z","title":"Available: https://arxiv.org/abs/2311.07911","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:41.484523Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:7e913bebfbd20d1c1882113c4d4d5c3809d7ab7af4d251bb03dc847bed9b1fb2","observation_id":"54853ea3-73e6-4c99-80e1-4982df7be0bd","resolution":{"observed_at":"2026-08-06T21:16:41.484523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15852","last_updated":"2024-10-31T14:43:58Z","snapshot_observed_at":"2026-07-06T17:49:28.257497Z","submitted_at":"2024-03-23T14:04:48Z","title":"SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15852","snapshot_observed_at":"2026-08-06T21:16:40.724767Z","title":"Available: https://arxiv.org/abs/2403.15852","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:40.724767Z"},"links":{"cited_paper":"/paper/2403.15852","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:86ddafe6b296b6ea638301247dbfc1903c5a0da971dc9ad420a25ebc26beb013","observation_id":"918c7b8c-6c40-4878-8711-7b74779eb127","resolution":{"observed_at":"2026-08-06T21:16:40.724767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21077","last_updated":"2025-05-22T23:36:42Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-29T20:42:59Z","title":"Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21077","snapshot_observed_at":"2026-08-06T21:16:42.794738Z","title":"Available: https://arxiv.org/abs/2407.21077","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:42.794738Z"},"links":{"cited_paper":"/paper/2407.21077","citing_paper":"/paper/2507.00699"},"observation_digest":"sha256:addcda9ce65f4d3849156db5bf0b491f9fce9d9d42488d84911672146677d9ba","observation_id":"eabb4b14-24c4-49af-a418-bedcec7e29c1","resolution":{"observed_at":"2026-08-06T21:16:42.794738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00699","last_updated":"2025-07-01T11:51:40Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-06T21:06:45.971799Z","submitted_at":"2025-07-01T11:51:40Z","title":"A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 5 inbound Pith citation observations for arXiv:2507.00699."}