{"as_of":"2026-07-31T15:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19ce0931f78a0a560657bb86d3efbb1043c38827686f87bbb3c54e2689763de2","coverage":[{"denominator":161,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T05:16:58.549058Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-31T06:34:12.847434+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07619/citation-record","integrity":"/paper/2607.07619/integrity","json":"/paper/2607.07619/citation-record.json","paper":"/paper/2607.07619"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:17.155439Z","title":"Breakthroughs in statistics: Methodology and distribution , pages=","venue":null,"work_id":"962860c9-1d4e-4316-ade5-0893cdae1394","year":1992},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:31a4e7130b41264b3beb257978c90f1323343a871d435bce6174f4a92aee18fe","observation_id":"3dc05d99-6545-4cb5-8cb8-6cb59d2262ad","resolution":{"observed_at":"2026-07-09T05:36:01.148720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10664-021-10072-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.106986Z","title":"author Ralph, P","venue":null,"work_id":"2dccb941-96a8-456e-be4d-60a993b2b026","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:0d4e10ef9b162a39ed7c792ffa294dc74518f9bf8356f6d1821d68d65d246180","observation_id":"acfb784e-67c3-47a4-8f9a-c293c511fe68","resolution":{"observed_at":"2026-07-09T05:26:01.109354Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:25.901158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:25.901158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.214660Z","title":"Educational and psychological measurement , volume=","venue":null,"work_id":"8393005b-33e9-4f9a-94fe-99344b92fa62","year":1960},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:947aafae851b49de22848b9010d61874e5cb1e4744f12100c75d362ff4fcc42f","observation_id":"d34e65bf-9ed2-471e-9233-913e05179d33","resolution":{"observed_at":"2026-07-09T05:36:01.216623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.606265Z","title":"Biometrika , pages=","venue":null,"work_id":"955184f9-b809-4e79-9d26-bcd54dcaa395","year":1908},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a56c4e03f9bbb402d84b74bc52365d1fcf17e98952f2b48ee98b18ce0a564689","observation_id":"fe24e569-5235-495e-8778-02cb696b51be","resolution":{"observed_at":"2026-07-09T05:36:01.163104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.221322Z","title":"Breakthroughs in statistics: Methodology and distribution , pages=","venue":null,"work_id":"f32386cb-5621-4596-9845-9b9fa070bc01","year":1970},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3886b0b492fe8a3843a0fb658036d87fffcfd74da7a9922aac81e4be78042e4b","observation_id":"fd78b4db-1995-47ae-9a75-a254d04906e1","resolution":{"observed_at":"2026-07-09T05:36:01.223370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.120840Z","title":null,"venue":null,"work_id":"146daab0-5977-41b2-8fab-3134a51db2e4","year":1900},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:2b88038bcaed348a1e878538be1c4fc9887206b6ca091648956d8daad58eedb7","observation_id":"dca09601-3147-446f-80d2-1c4acc0cdea6","resolution":{"observed_at":"2026-07-09T05:46:02.122374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.266105Z","title":"IOWA , author=","venue":null,"work_id":"331018a6-549d-4206-a04e-0bd08f8d04bc","year":1989},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:57b471d22a78ee17b05fbf9ff6a4f6483c9b2ea8162d13554fa4e9e23d0c723f","observation_id":"f9d0b908-ac58-463c-8952-ae9b9214289b","resolution":{"observed_at":"2026-07-09T05:36:01.267905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.646008Z","title":"Biometrika , volume=","venue":null,"work_id":"dae55a61-08c0-4b31-bfa5-46d4c1673705","year":1947},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:4da545bf3b594f73c66e55cda7272023069e810876062fe18c2e9e1a87bf3bbf","observation_id":"bec1610c-c54d-4c47-8e4f-25402746903e","resolution":{"observed_at":"2026-07-09T05:36:02.647556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.648392Z","title":"2009 , publisher=","venue":null,"work_id":"26f5b3cb-ed7e-42f5-a988-e4e0a5c7885a","year":2009},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ed9145a99d9ddc930772330ccf29ecaf925926bf092b6598c62dcb9466353dc2","observation_id":"8b607199-d697-40fe-b552-57c8dc90bda7","resolution":{"observed_at":"2026-07-09T05:36:02.649714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.635017Z","title":"Information and Software Technology , volume=","venue":null,"work_id":"913e235c-3c6e-444b-b557-ce8b1f85ea45","year":2007},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:670a313a44ec6bc25e361764cff5389a1c15311d4a23d6192453662ce0cb4db4","observation_id":"1e8f7f04-8804-41ce-9993-36935cbda212","resolution":{"observed_at":"2026-07-09T05:36:02.636423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.653076Z","title":", author=","venue":null,"work_id":"02c4e005-0d71-4d4b-8db0-aed2e1c02df2","year":1993},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:380d02e39891c59ac82099779bef07bb4b5d40c6f278482db270c46f2977d351","observation_id":"002f5173-df22-4d6c-93a8-ba36247a9163","resolution":{"observed_at":"2026-07-09T05:36:02.654341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:07.377082Z","title":"Biometrics bulletin , volume=","venue":null,"work_id":"d528032f-514a-4f63-8d4a-c6910bb5d58d","year":1945},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:49793a5c2ed54d77c851b8d483718836561667b53a43b72863a6d1c578be72af","observation_id":"ce30ab09-cb96-419f-8948-5d2a941fd5aa","resolution":{"observed_at":"2026-07-09T05:46:02.088696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.610109Z","title":"The Journal of Nervous and Mental Disease , volume=","venue":null,"work_id":"d87b0fdf-8e29-4135-a3f3-45496ce51262","year":1957},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3bf2f869fe5075fb7fea40555196389179eb823c460b589c5655991e6625f135","observation_id":"c70f330e-d95a-4f5f-8be0-065ba12e66f3","resolution":{"observed_at":"2026-07-09T05:36:02.611608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6628.2025","doi":"10.1109/msr66628.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Devanbu, Christoph Treude, and Michael Pradel","venue":null,"work_id":"52282e0f-2551-44cd-8740-aeb6b8647f0f","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a4ef016395a6655acf2216bd088561902426a2435e7362f6a6ae7b99f9cc8cf3","observation_id":"da3d9738-4d0e-4556-a515-442a6ea6a0e6","resolution":{"observed_at":"2026-07-09T05:26:01.136701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.16594","doi":"10.48550/arxiv.2411.16594","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":"6654304a-22e0-4b16-93cf-36e7fc38ae5a","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:fb154fd5f33a0e9bd7c16ee2d0ec52eda909f4347f7bd97003f7aa2323518d09","observation_id":"da2efc50-d426-43e3-b0ad-b580e25bcdc7","resolution":{"observed_at":"2026-07-09T05:26:01.089108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:26.997979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0457.368807","doi":"10.1145/3640457.3688074","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proceedings of the 18th","venue":null,"work_id":"5b3b6918-d9c6-46a1-9de1-e01d05f464b1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7f359b99e756ab68fd1be8afc8dcbc9f5ac9e9fa7e535a606dc45504fba78929","observation_id":"d63cd483-321c-4a1e-8dc5-6f159ee94db9","resolution":{"observed_at":"2026-07-09T05:26:01.174380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.149730Z","title":"DeepSeek Chat , howpublished =","venue":null,"work_id":"8b5dcd84-153f-402b-a594-011e01d3e137","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f00a69047083373bf89d691897ac2ca7570bc561c5f53e71fdbc514016143299","observation_id":"75bd5282-35ce-4f69-845b-02fd26065bbb","resolution":{"observed_at":"2026-07-09T05:36:01.151418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.237762Z","title":"DeepSeek Model , howpublished =","venue":null,"work_id":"104eccd0-b096-40fe-96e4-a70c1d5e5716","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c64a3f521a954fd25e16272ad7923d811a60a58ccbdae78a2c44335ac0103ec4","observation_id":"09eaa7ce-a107-4eb9-a789-4b29ab00c273","resolution":{"observed_at":"2026-07-09T05:36:01.239298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.212023Z","title":"ChatGPT , howpublished =","venue":null,"work_id":"2e8e269e-a644-431a-a140-9afdeca5d781","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1a3e8443419bcdc543022d85ad602271b4a9c3b79d31a50de6242178690acf87","observation_id":"3593a4a1-49ef-4a1c-9e79-9e4a92269d0b","resolution":{"observed_at":"2026-07-09T05:36:01.213591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.232600Z","title":"Gemini25 , howpublished =","venue":null,"work_id":"6db726b1-23e8-4e66-a3ec-8f91facdcd3d","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7f3a3fbae3e6c8ccf9588610dea5f2ea40e8bcd93df76fece61c8a86e3a5dcec","observation_id":"bf392ddf-d045-42a4-b749-b5adfa973bad","resolution":{"observed_at":"2026-07-09T05:36:01.234230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.170412Z","title":"claudesonnet45 , howpublished =","venue":null,"work_id":"4011437f-f328-4ef6-a170-37bde3ba0edd","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b51363cec328bdd2262ee289511dea790e0e1352daf1a1dd11b7ef1d4d8931c5","observation_id":"67b7d851-4c75-4fd4-a8bb-392987f63ccd","resolution":{"observed_at":"2026-07-09T05:36:01.172238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.164112Z","title":", author =","venue":null,"work_id":"a71626d1-a320-4ef7-b2c0-eec6afa2c3fd","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:43d8a642b4272f0c7852a05835e6e067271ae5f4affd89f7615c89da28d1be5f","observation_id":"cd2ee14b-3790-4f90-8531-b80ed1616774","resolution":{"observed_at":"2026-07-09T05:36:01.165779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.182898Z","title":"Journal of Machine learning research , volume=","venue":null,"work_id":"f31d4fb2-85d3-4b14-b951-b14232e27f92","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:dfdf803cdd64b5307a4f6c346cec760bec6d2a2109444cf9ee37ada7fb9681bd","observation_id":"fcc426f8-6dde-42e8-a42c-5f4e608b4cb8","resolution":{"observed_at":"2026-07-09T05:36:01.184980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.158159Z","title":"The annals of mathematical statistics , pages=","venue":null,"work_id":"b28ec081-85cb-4c46-8a3b-0992f53a755d","year":1947},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:6f51b1c9f81bb8a5e3703adf5de20edd8ecf4f0b7b588cc210b280ef969f0d6d","observation_id":"1232e5c0-4553-4a5c-94c3-179905eb8afc","resolution":{"observed_at":"2026-07-09T05:36:01.160417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.103932Z","title":null,"venue":null,"work_id":"bf514cb4-36f8-4848-884e-5ab2f906fe0d","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:4dc28b353a2382cbf9e1b5feef809b85768b5751189e0f7cc456ea907d776429","observation_id":"131881fe-6e7f-40a8-b6fe-ed8246c091b4","resolution":{"observed_at":"2026-07-09T05:46:02.105787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.588730Z","title":null,"venue":null,"work_id":"ad0c432d-8ccf-4d0c-8e7d-a405e2f1e3da","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a57c1a67acfb70d792a487f4a0bf5320c085bdafa4ec1a91d9343a19752ec31a","observation_id":"9ecce98e-2188-4ac6-bf3c-97461a7e38b4","resolution":{"observed_at":"2026-07-09T05:36:02.590323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-naacl.197","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.180461Z","title":"TestEval : Benchmarking Large Language Models for Test Case Generation","venue":null,"work_id":"e6666e1a-6b9a-4dcd-a91c-9b0f263f8aa9","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d7880270b2251afe808d4b1ccd9f7151a9a4300e44189285f8944f54594c6345","observation_id":"0c2f5bdd-b131-4300-b97b-c493b13a97e9","resolution":{"observed_at":"2026-07-09T05:26:01.182655Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:27.974377+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:27.974377+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.04295","last_updated":"2016-08-15T15:02:13Z","snapshot_observed_at":"2026-07-31T02:25:55.049680Z","submitted_at":"2016-08-15T15:02:13Z","title":"Robust benchmarking in noisy environments","version":1},"cited_work":{"arxiv_id":"1608.04295","doi":null,"metadata_source":"pith","pith_arxiv_id":"1608.04295","snapshot_observed_at":"2026-07-09T05:26:02.125184Z","title":"Robust benchmarking in noisy environments","venue":"cs.PF","work_id":"2f3836ca-cfa8-4a88-a80e-28d99ec5d81f","year":2016},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/1608.04295","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b73b440b7abdf58c7282e30021e0682bcd6b7ee73b16801db787b0e804b72155","observation_id":"f3a21cfc-654f-4d83-9484-3509ef71d1d8","resolution":{"observed_at":"2026-07-09T05:26:02.127013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8149.108819","doi":"10.1145/1088149.1088190","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proceedings of the 19th Annual International Conference on Supercomputing,","venue":null,"work_id":"575814ec-9c09-49ff-9157-4c9c4e50d71d","year":2005},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:95707da49cc82b61dc455cb5f972ad89dbac4a745546307b514e5477eb64f867","observation_id":"175216fa-9799-409d-8d00-9b4c47baa496","resolution":{"observed_at":"2026-07-09T05:26:01.118433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:28.509145+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:28.509145+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6972.106982","doi":"10.1145/106972.106982","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Mogul and Anita Borg , title =","venue":null,"work_id":"9822b84f-e695-45b8-a767-3b3dcd64a8d9","year":1991},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:931b3df0ce404d405f193a2291117f5487e917556cf9e1bfaa00440c91c3235a","observation_id":"a3e96f8d-0b26-4b8f-8f9e-fc2af429bed4","resolution":{"observed_at":"2026-07-09T05:26:01.179288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:28.993112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:28.993112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf03356746","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.098847Z","title":"Tyson and Matthew K","venue":null,"work_id":"441a5fd9-19b7-4c9d-b6ff-21fc4713ffe6","year":1996},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3ab69aa716a70df216056591b293e7b10133b6db70be54ab038f8f255c5dfac7","observation_id":"2c1fe6bc-282b-45b7-9167-17afa9b8e7b7","resolution":{"observed_at":"2026-07-09T05:26:01.101433Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:29.443703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:29.443703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.604193Z","title":"Tyson and others , title =","venue":null,"work_id":"4bc9fe4a-e973-4e60-a2a4-b4b1e44540b8","year":1999},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:725af38a043019917ce5834a882b155f66225c955154a17cf058e7bec154ec84","observation_id":"d410037b-3811-4b88-a02a-e2f338c29737","resolution":{"observed_at":"2026-07-09T05:36:02.605587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/12.752652","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.079933Z","title":"1999 , url =","venue":null,"work_id":"8edd7b4e-5d9d-4bd8-b762-1ba9200e3cc6","year":1999},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ebd4fe7c3d86ccce73078138db7ce3c5417084788b41e94d56e14385fdc21f85","observation_id":"9a758395-9f83-4893-a6fa-41b9df04ceff","resolution":{"observed_at":"2026-07-09T05:26:01.081703Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:29.95489+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:29.95489+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.573752Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":"1252fdca-5909-49c2-83c3-cd66eb54c21f","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d221e8ddad7eb682c29483c9fec7d4998648acae3ed52ecf9d3a7c7a18161727","observation_id":"c07b46fd-a812-47a1-a574-a2cc46901fe1","resolution":{"observed_at":"2026-07-09T05:36:02.575326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715727","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.016749Z","title":null,"venue":null,"work_id":"dd35a466-7af5-40fa-bbe5-4722fea85882","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:5323e3722fd84c2b4d86094bc7de5a9d8d2235e115ff4f1394d1bb1e8d3a8a2b","observation_id":"3eddb141-00ad-4841-b88b-3a2aed730b3e","resolution":{"observed_at":"2026-07-09T05:26:01.018502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:30.526928+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:30.526928+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15963","last_updated":"2024-09-29T05:03:25Z","snapshot_observed_at":"2026-07-06T17:21:42.659240Z","submitted_at":"2024-01-29T08:47:31Z","title":"NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness","version":3},"cited_work":{"arxiv_id":"2401.15963","doi":"10.48550/arxiv.2401.15963","metadata_source":"pith","pith_arxiv_id":"2401.15963","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 8647–8657","venue":"cs.SE","work_id":"26ab46a9-ed1e-4a22-bf52-e1daff58ba15","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.15963","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:df604ea9e61bdc3e6d531e612e9ebb64444d8d562bc6311e6a50d60b19dd2851","observation_id":"6f251ed2-c4c3-4a5f-ace8-0d11013bde83","resolution":{"observed_at":"2026-07-09T05:26:01.002164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:31.072404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:31.072404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.593535Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"09578760-f271-40bf-a872-b28c9666663f","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b86b39b13d697449feb3460e2ae5e79e3820d0a66ef6d740d36786da11c6bbed","observation_id":"e340eaad-bcae-43a1-8b69-8fb9a37cd780","resolution":{"observed_at":"2026-07-09T05:36:02.595190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.612460Z","title":"Proceedings of the ACM/IEEE 42nd International Conference on Software Engineering , pages=","venue":null,"work_id":"0f2b47f9-cedb-410e-8d08-303390cbbc48","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ce94615b82212d8a0401f834288a1ddf2df4f984e040acd9e91343e3bec3d9f2","observation_id":"8facd045-87ef-43d2-a3a5-1ab6d8c22dcc","resolution":{"observed_at":"2026-07-09T05:36:02.613991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.171389Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"77db713f-99b6-4839-b1f0-bd73541d4b74","year":2020},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e965200423fb3a28292ef11d0ef1d50440490c836cf404e502f6153d612a0425","observation_id":"6c939dc0-c918-492b-b3ab-5c1a90c9449a","resolution":{"observed_at":"2026-07-09T05:36:02.173007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.178664Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"83c90b79-2649-45b4-b47a-3c3a1a3ae0ed","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:25b18342d0449a0c4808c6eed8bbf6a530934960739ba43cbfc1c124e1517853","observation_id":"907cc97e-f9cf-46b9-8692-dca6caa951ed","resolution":{"observed_at":"2026-07-09T05:36:02.180435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.579419Z","title":"Proceedings of the 38th international conference on software engineering , pages=","venue":null,"work_id":"1116a68e-52be-4ae0-a42d-60226427f36b","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d105329591b6c984fe66f4fce70381e36bc6506fbc67710bc3a8c824e367886f","observation_id":"cf6fe173-407d-4b1f-9d17-894d3ca4fc8b","resolution":{"observed_at":"2026-07-09T05:36:02.587304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.650496Z","title":"Journal of Systems and Software , volume=","venue":null,"work_id":"27b0ef35-2884-48df-a98b-71b9507b768f","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c454e4f879aa43be4d40fbcd7d503592fc54450322d9e253f4adf9e414dce724","observation_id":"ab3260c3-45c7-4c8f-b344-de75ed63c2f0","resolution":{"observed_at":"2026-07-09T05:36:02.652238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.176096Z","title":"Proceedings of the IEEE/ACM 46th International Conference on Software Engineering , pages=","venue":null,"work_id":"3990a3ea-9aff-49ec-af95-02a43f15ad32","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:9314f17a83a36341423865c62f4477bd76b504dbf8418671e5b9afb527e5becd","observation_id":"f604e6a7-bd4d-43f0-a540-0fc5dfe46f29","resolution":{"observed_at":"2026-07-09T05:36:01.178117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.155291Z","title":"IEEE Access , volume=","venue":null,"work_id":"f513c666-7236-44c7-afe3-743289450761","year":2019},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c2f1eb520288df2aaa3dcea32ec09079058b1e82b86847047cc93fb8bb7b5cc1","observation_id":"d0f53d18-cd9b-43c1-95a0-d8154c578290","resolution":{"observed_at":"2026-07-09T05:36:01.157088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.242621Z","title":"IEEE Access , volume=","venue":null,"work_id":"7ae24c89-dd46-43ca-bdb5-8411f0ce9b04","year":2019},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:23c9c84ce4fd1696da440a51ba5f0bcdbf66f661b4827ad5fa14af7974c32a43","observation_id":"20541f37-aae0-4864-b8b7-a454d2fb2bda","resolution":{"observed_at":"2026-07-09T05:36:01.244350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.195268Z","title":"2023 IEEE/ACM 45th International Conference on Software Engineering (ICSE) , pages=","venue":null,"work_id":"8ba70a4e-07c1-4746-89de-c2dfa477dcdd","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d0a2a64a7c592ed2b9e089cd6668ee0da6305e581133fc51c78ff982a39d9914","observation_id":"2c420f38-9fab-47dc-80c3-f24f43f6dcd9","resolution":{"observed_at":"2026-07-09T05:36:01.197483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.173116Z","title":"Information and Software Technology , volume=","venue":null,"work_id":"63e3388f-5b98-4244-ba6a-b42db05ccad6","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:5d7f065473af409252e7270270fc5096768d18198285167ad9043ab5e5879bfb","observation_id":"a56f1596-5f88-430a-b335-4129261f59bd","resolution":{"observed_at":"2026-07-09T05:36:01.175079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.083567Z","title":"2023 38th IEEE/ACM International Conference on Automated Software Engineering (ASE) , pages=","venue":null,"work_id":"0c8a4013-d40a-4c16-bf0d-e07ac142dc24","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:789a344c8ce98d28980bf2b3e00881967dca5590eeb64d0d46079a4534ede44b","observation_id":"8cb649b0-311a-4c5b-ba59-8b49f5673e4d","resolution":{"observed_at":"2026-07-09T05:46:02.085408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.179581Z","title":"Proceedings of the 33rd ACM SIGSOFT International Symposium on Software Testing and Analysis , pages=","venue":null,"work_id":"0dda9ea0-ba32-4677-b731-2e78b136df4b","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a7511f75ff4b9d7d40110b5f42e61a6aa4526830b05c1a8e39f7214df68bf1af","observation_id":"7c37771a-cd44-45bf-942e-d1f762178006","resolution":{"observed_at":"2026-07-09T05:36:01.181727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.192224Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"2c7fa5c1-bdfc-43a8-9f40-de29c928c858","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7c00b4cddc9bef4db7f3f43cc8000f35563408b24c22a521093ca2ab425b4ac1","observation_id":"f547b1ae-5aab-4844-adab-55af4b30c67e","resolution":{"observed_at":"2026-07-09T05:36:01.194201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.209043Z","title":"Proceedings of the ACM on Software Engineering , volume=","venue":null,"work_id":"7651fdac-3acf-439e-9e9e-409856055b62","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e7cb5d135dfd25dd3a76da3571f3c0f82266e892c9b61f7f2c9aaddbcdb77362","observation_id":"e18e37f9-3f1f-445c-8073-72f0a1eb9358","resolution":{"observed_at":"2026-07-09T05:36:01.210964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.217588Z","title":"Proceedings of the 27th ACM SIGSOFT international symposium on software testing and analysis , pages=","venue":null,"work_id":"cc4b4b91-e89b-4d92-a247-7ea58269afdb","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:52794e891e68ec95a02447c9c22323e0bfdcaa2ac689ae2fd6867278b9980def","observation_id":"01a0de30-6fd4-4288-aea6-18978835a55c","resolution":{"observed_at":"2026-07-09T05:36:01.220351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.591245Z","title":"Proceedings of the 2017 ACM SIGSAC conference on computer and communications security , pages=","venue":null,"work_id":"76e55058-ebed-4e97-90fb-8332e733125b","year":2017},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3ae153fda17b42bd7d583fc145b13630dbe2e41a894fef1242abd86910f7f9c2","observation_id":"337665cb-881f-468d-adae-1c59ca0a4425","resolution":{"observed_at":"2026-07-09T05:36:02.592773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.166713Z","title":"Proceedings of the ACM/IEEE 44th International Conference on Software Engineering: Companion Proceedings , pages=","venue":null,"work_id":"9d07ae8b-56ef-41a2-b36c-c44aa2429be1","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:03ea5d7bc8f3d5b2145bc780632bef445ca85faaf4aa155b12783d76497663ad","observation_id":"7c554f65-41fd-4dfa-9a5e-9c05b416b4b7","resolution":{"observed_at":"2026-07-09T05:36:01.169194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.250417Z","title":null,"venue":null,"work_id":"dbb7428f-592b-4bef-b0cb-e0dee1ab3251","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:9aaf44d5f2c2c9950600ed6a3553278ab39ca00a340f7db5ab27a497053b535b","observation_id":"4edbe300-8d74-452e-b799-8b5c334ab5e4","resolution":{"observed_at":"2026-07-09T05:36:01.251943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.272119Z","title":"Forty-second International Conference on Machine Learning,","venue":null,"work_id":"28e46ca7-9429-4545-861b-fb5bb25a0895","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e9e09403709f00014f5c624540216e83315158a62f27711e8c9c0067603343ba","observation_id":"ed2840f6-bdff-48a1-8555-d6f1f08d9e4f","resolution":{"observed_at":"2026-07-09T05:36:01.274104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18489","last_updated":"2025-02-17T07:01:18Z","snapshot_observed_at":"2026-07-31T01:44:52.711618Z","submitted_at":"2025-02-17T07:01:18Z","title":"LLM4EFFI: Leveraging Large Language Models to Enhance Code Efficiency and Correctness","version":1},"cited_work":{"arxiv_id":"2502.18489","doi":"10.48550/arxiv.2502.18489","metadata_source":"pith","pith_arxiv_id":"2502.18489","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Llm4effi: Leveraging large language models to enhance code effi- ciency and correctness","venue":"cs.SE","work_id":"96cfe6bf-bed2-41c3-8192-599b036e173d","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2502.18489","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:698f773e1a8e26dca3f5abe6adf4f49acaf253e3011e2ace36456f194db674a8","observation_id":"4b7d47f7-e172-4a6e-8beb-f6c2375c95b2","resolution":{"observed_at":"2026-07-09T05:26:01.122754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:31.588021+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:31.588021+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20124","last_updated":"2025-08-24T16:47:19Z","snapshot_observed_at":"2026-07-06T22:19:38.462418Z","submitted_at":"2025-08-24T16:47:19Z","title":"Towards Better Correctness and Efficiency in Code Generation","version":1},"cited_work":{"arxiv_id":"2508.20124","doi":"10.48550/arxiv.2508.20124","metadata_source":"pith","pith_arxiv_id":"2508.20124","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Towards Better Correctness and Efficiency in Code Generation","venue":"cs.SE","work_id":"ddf6f968-ec41-4691-af9b-cf4c4a22aa5b","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2508.20124","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:269e1907b45c8a24595f3ddc93e5e770ca0facdbc838504a7a6fc67661892dec","observation_id":"6bd5dfd4-3990-4fbe-bb1a-65a125f79080","resolution":{"observed_at":"2026-07-09T05:26:01.063164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.023945+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.023945+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.229885Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers),","venue":null,"work_id":"203615c4-1318-40db-acdf-2e19ea6e30e7","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:400c606b4c847c3ce1524e2ada9ec18251604a2ac086006fe62bf13816a03005","observation_id":"222379f6-1f7c-441e-a3bb-67954cf7fff7","resolution":{"observed_at":"2026-07-09T05:36:01.231582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.358574","doi":"10.1109/access.2025.3585742","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"2025 , url =","venue":null,"work_id":"efaff597-4523-433c-bc02-fdef396b1163","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:593843763fd74a10cdb45f4e7277fa15992f0dd0c6f72c9c3dc1fb733240ce64","observation_id":"363b706f-b518-43ef-9cac-f1d1d6850e6a","resolution":{"observed_at":"2026-07-09T05:26:01.131122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.532518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.532518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.106683Z","title":null,"venue":null,"work_id":"0c16ac67-bc31-47dc-973c-19afccbd5174","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c39ee492aa06cd0e80491e9346a63c1fce91992a5e753ea079d6487c9e51cd93","observation_id":"b7632066-662c-4420-b287-2253f7fe7a85","resolution":{"observed_at":"2026-07-09T05:46:02.108334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.050177Z","title":null,"venue":null,"work_id":"5f2e826f-ee01-4ecc-b6b8-d13c83f15110","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ce1450bdba0f5a2a3ef257575553783c1eb3aff07281ce3f340d05d85badbd96","observation_id":"06895d48-b862-4717-8233-abc4ca6d2d21","resolution":{"observed_at":"2026-07-09T05:46:02.052193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.057655Z","title":"2025 , booktitle=","venue":null,"work_id":"4c7971b3-cca1-41e1-90f4-6a7a2ec00258","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f00c0354818f3714aa7f3f4b546e32081e0ff66d1dc4f6f52f4d026ba27f5d24","observation_id":"70a49bd6-6160-4d79-946c-c35cf4b57846","resolution":{"observed_at":"2026-07-09T05:46:02.059319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1186.321192","doi":"10.1145/321186.321192","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Simon , title =","venue":null,"work_id":"4587aaa0-62cb-4343-bc5f-f954e166ca7f","year":1963},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:d880046bb283a649933b96bcfc16cfa4a927d9b022aff74f13c80432a2d7c97c","observation_id":"9ef1df8e-ec1e-4bee-9e8d-20252471d1f1","resolution":{"observed_at":"2026-07-09T05:26:01.114097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:32.969761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:32.969761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.252828Z","title":"Shaw and others , title =","venue":null,"work_id":"7a2f47b1-aa55-4694-a5d9-8c596f5aab3b","year":1975},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:732e3990294e58d6b927853df16f314dbac738bbc266bcabce1a8010ab808adf","observation_id":"6e91cc5f-f75a-46df-93a2-85c12be4269c","resolution":{"observed_at":"2026-07-09T05:36:01.254539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6385.192642","doi":"10.1145/1926385.1926427","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: POPL (2011)","venue":null,"work_id":"ab5c76d6-dfb1-4003-9cc7-363ed842dbed","year":2012},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7c32626102d2938fae8ec5087b49ab4c6a973806cd58e6fafa4bce659b23f3dc","observation_id":"a4ce6a93-8519-483c-890c-d82f54fd5027","resolution":{"observed_at":"2026-07-09T05:26:01.039755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-18T00:51:19.455381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T00:51:19.455381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.248105Z","title":"Waldinger and Richard C","venue":null,"work_id":"a3b31390-643f-48ee-8457-f6d0826c4ab5","year":1969},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7880e6dbbf8ea80db015e8d4c9fc5f97c9034ebc189e35a31fbb09bf41429ffe","observation_id":"3539dbfa-2e26-4f8d-b88e-affce2135793","resolution":{"observed_at":"2026-07-09T05:36:01.249679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2566.362568","doi":"10.1145/362566.362568","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Waldinger","venue":null,"work_id":"476643d1-2396-4935-8922-a76e63fd2f21","year":1971},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f6683533c9aa5ed2c3d29aefd1dc206881da5ab93f10f8deb125c4c4a9b5f4fc","observation_id":"aa4eb889-b347-463d-b1e1-154e5eacfd53","resolution":{"observed_at":"2026-07-09T05:26:01.054980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.914342+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.914342+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.206476Z","title":"Cordell Green , title =","venue":null,"work_id":"dbf423a3-d7c8-4db4-ac0f-df6a9b293343","year":1969},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:fdf21754825dcdcdaa6976caf06d545d2f2ba1561567ffd879c235c204720d93","observation_id":"05bdd701-2eb0-4ab0-a4e6-3ebecddc6bf2","resolution":{"observed_at":"2026-07-09T05:36:01.208084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.095016Z","title":"6th International Conference on Learning Representations,","venue":null,"work_id":"e1de89da-ad98-4c97-b82d-22a5d7a1c9ae","year":2018},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1c38fc291b1974a8aea888bf6eb0c7bfd1cd8fe539b2a44598af202236ce9d5f","observation_id":"8d6accf6-d999-4443-981a-5e3bd4ade773","resolution":{"observed_at":"2026-07-09T05:46:02.096776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.189455Z","title":null,"venue":null,"work_id":"6a50dec6-3c59-4c83-8753-0eb65a45bcc0","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f8273f9ec0c32ce6d1f56aabfd675ff0f7872483d2bafb0106812d258ff61446","observation_id":"b1611c7e-97d8-4a1d-9878-af02dc5d75e1","resolution":{"observed_at":"2026-07-09T05:36:01.191262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.077781Z","title":"Foundations and Trends","venue":null,"work_id":"48acbc34-9ac7-4be5-8487-473cd052ebcb","year":2017},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:35e084643ba5b24d12ea0d9dbf97ce7a18662bcdb1e430b19fc43cf8cb756459","observation_id":"d026c53f-b64e-4bc8-a598-531dcee893f8","resolution":{"observed_at":"2026-07-09T05:46:02.079578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":"2203.07814","doi":"10.48550/arxiv.2203.07814","metadata_source":"pith","pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Competition-Level Code Generation with AlphaCode","venue":"cs.PL","work_id":"00d9ab4d-e694-4677-8132-332873a8f9a7","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c184535bf6461eb44fb924eeeb850778766dd5a748997b52763ea9e73f38fd8c","observation_id":"77e5cd76-c43f-48e6-868a-e6446d139c28","resolution":{"observed_at":"2026-07-09T05:26:01.144105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:34.328608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":"2203.13474","doi":"10.48550/arxiv.2203.13474","metadata_source":"pith","pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","venue":"cs.LG","work_id":"892a192d-205a-4079-a807-00d7874b392e","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:42a7734669e4b3d62a283919b4c59e30a170981db28e6006ca57b4cfb4c2b33b","observation_id":"1247bc9e-46de-4ad8-bb8b-64a88aa3b93d","resolution":{"observed_at":"2026-07-09T05:26:02.119353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.68","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:26:01.064267Z","title":"In Proceedings of the Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, December, 2023, Singapore","venue":null,"work_id":"5084b60a-90d0-4510-bc14-97091bb61f88","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:513cb0bc84054c52747ef08d7d70f2216cc8ff92990f043db20d812f1ec348e5","observation_id":"0cbfa65f-c166-427b-8a5a-03d1dc53dcfa","resolution":{"observed_at":"2026-07-09T05:26:01.066720Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:34.852909+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:34.852909+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:46:02.100279Z","title":null,"venue":null,"work_id":"b38dcafc-df26-43df-b85c-580b543f9d0f","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:bb0e8b7a69812069d8e8e57b39d8c235c01a0e81af101f137bc059ac1c07211f","observation_id":"1cdf3c40-124e-4554-839a-8ac2652d59bf","resolution":{"observed_at":"2026-07-09T05:46:02.102413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.275105Z","title":null,"venue":null,"work_id":"77bf37b3-4f24-47d9-82a2-5bee1bad78a5","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:db510005d08334de26dfb004eca8ca4e45d98c8d05a81981bd8cf7835f05889c","observation_id":"bbe5679d-44b9-43ca-b627-2af5fb9ba813","resolution":{"observed_at":"2026-07-09T05:36:01.276676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":"2204.05999","doi":"10.48550/arxiv.2204.05999","metadata_source":"pith","pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","venue":"cs.SE","work_id":"e98a5559-529d-48b1-833c-b85b662f190c","year":2022},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c473395074b7e046e176f651b148633370c74948129aa63d723508e2500bfcdf","observation_id":"b4645939-b944-485e-9a44-f72731931aab","resolution":{"observed_at":"2026-07-09T05:26:02.096721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-07-06T14:40:01.183227Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":"2301.03988","doi":"10.48550/arxiv.2301.03988","metadata_source":"pith","pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-07-10T09:16:59.505127Z","title":"Santacoder: don’t reach for the stars!","venue":"cs.SE","work_id":"bf393c50-a11b-4a0f-8513-52428ede71f7","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:7b8399a0048f8a9ffbdfbd7e8a9a6c7de78255cfb75744cb1b3ee21d2dabde41","observation_id":"70853840-a8d6-487a-ab3d-982586435e2d","resolution":{"observed_at":"2026-07-09T05:26:01.048861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:48023ee1c30b02285bbe4b2a0837c6b755a8a6b9c5574de0749835d28f0c0a26","observation_id":"bc90ff6c-ec32-4bb3-96a4-d14ecf167a69","resolution":{"observed_at":"2026-07-09T05:26:02.115697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:60799498755b974514e2a06e6ec9872dd8e3f21fafb5fd2ec0bcc63dd0e49fdb","observation_id":"0cb8bd0c-01d1-42e8-873a-6479ea1e19a0","resolution":{"observed_at":"2026-07-09T05:26:01.126601Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-07-11T03:17:52.238641Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:b0001c94fd4690a6c62a2fc3cd21807437f6bcb73923e1eeddda2cf8091ce45a","observation_id":"654025cc-6061-4682-bf08-567956349037","resolution":{"observed_at":"2026-07-09T05:26:00.996749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00788","last_updated":"2024-01-01T15:30:19Z","snapshot_observed_at":"2026-07-06T17:10:32.750276Z","submitted_at":"2024-01-01T15:30:19Z","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","version":1},"cited_work":{"arxiv_id":"2401.00788","doi":"10.48550/arxiv.2401.00788","metadata_source":"pith","pith_arxiv_id":"2401.00788","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Astraios: Parameter-efficient instruction tuning code large language models","venue":"cs.CL","work_id":"67bf8efc-a5db-4dcd-afa0-4c2283efcfbb","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.00788","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:79254e81c61b073c6e6ab4f4437ed7c08d732e9e7c933bba8585308cf4bef4a7","observation_id":"63158b33-9d39-4c6d-b802-5857273c2c2d","resolution":{"observed_at":"2026-07-09T05:26:01.075601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:37.34905+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:37.34905+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:8ef8de0f43fcacb276f2475d003ab45b5f2f15411ee44172e1000ad8b1851076","observation_id":"c2a040a2-0cf0-41b5-9465-f474eb124094","resolution":{"observed_at":"2026-07-09T05:26:01.148862Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.637390Z","title":"Llama , howpublished =","venue":null,"work_id":"92723ce4-8e6e-4fe4-8d59-e07fc9703264","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:e0c0ee2bb83f3de7d7606145f28313836dc6ad880808315674675023c1b35a50","observation_id":"8558cbea-3730-4633-b8c1-e8a1a81d565f","resolution":{"observed_at":"2026-07-09T05:36:02.638824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.630401Z","title":"Anthropic , howpublished =","venue":null,"work_id":"e1d37e54-b496-4301-8dd9-d5e7227e6ee3","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3678aa72110c3f228d0fd6b067427c7630701efe2e4f1b83be38622b9a559ee3","observation_id":"857b7a33-6bc3-421a-b3af-88b9b30255b7","resolution":{"observed_at":"2026-07-09T05:36:02.631833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c7dba3d6cffd1e78935972f1c0605181e85e3ead1f0bc57976932020c5943033","observation_id":"b642fd0b-5eb1-4abd-93ad-ad2cf96c0cbc","resolution":{"observed_at":"2026-07-09T05:26:01.015668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:38.602608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:38.602608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-11T03:27:47.028679Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c2aa3bf5984450f1157adf5359db6448d16602607e4c5a09bfc4aa11fca9d957","observation_id":"55bd9041-6d7d-4cca-8e49-ec24a0677a41","resolution":{"observed_at":"2026-07-09T05:26:01.010795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5347.2025","doi":"10.1109/icse55347.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"2025.IRFuzzer: Specialized Fuzzing for LLVM Backend Code Generation","venue":null,"work_id":"c383b7e9-bd1e-4268-b134-a4e43d7560a3","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:a0e9d10a7b74715770aaf0f10daf97f31539e85a477ede2cecf3476542729a16","observation_id":"e164568e-c3d3-4981-91e2-85f1d44d3d52","resolution":{"observed_at":"2026-07-09T05:26:01.105667Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13535","doi":"10.48550/arxiv.2509.13535","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.317089Z","title":"Crash report enhancement with large language models: An empirical study,","venue":null,"work_id":"99f03577-046b-4709-8771-457484be52ce","year":2025},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:52b881ebf05d09f9ddc9f8dd6e1eb0e7bf41d73cf74ae270fc02d3c58f129d70","observation_id":"8d769afd-e257-4eac-977b-2723e0160da7","resolution":{"observed_at":"2026-07-09T05:26:00.990580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:40.217731+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:40.217731+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.632685Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"92e1e086-9e03-4224-bcc0-937bf199012f","year":2023},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:f427f93714ddd27b0b980866d2789307559ce03e4e32ef2a523ba27fff4f790e","observation_id":"99af4452-8485-45f8-a4f7-43892cf8e401","resolution":{"observed_at":"2026-07-09T05:36:02.634196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.639661Z","title":"Proceedings of the 29th International Conference on Evaluation and Assessment in Software Engineering , pages=","venue":null,"work_id":"7943d3c7-8362-4dc9-a5c7-97b054369a32","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:c98890076580856c29a78206d878bf69c1ac68c4f77ca4fb2a625bfed6f1136b","observation_id":"1382c003-154e-4081-8fdd-0f9514fdc0a8","resolution":{"observed_at":"2026-07-09T05:36:02.641152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.625438Z","title":"Proceedings of the 29th International Conference on Evaluation and Assessment in Software Engineering , pages=","venue":null,"work_id":"798d3e50-06af-444a-a932-da983f5caaad","year":null},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:418cb6223ac0d489937adf0c5f4f37e1dcd14f052d3c537a9552607bd2d47ffd","observation_id":"b6d9865a-4ec0-49c2-ab5e-0d9244f2a7ba","resolution":{"observed_at":"2026-07-09T05:36:02.627088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.627944Z","title":"Proceedings of the 2024 IEEE/ACM First International Conference on AI Foundation Models and Software Engineering , pages=","venue":null,"work_id":"656bddf3-8fc6-43b4-a8ee-53b3437ae3c4","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:68713ee75cd59116160a1932053944c4fbf924ee7999929b807592754b1c76c5","observation_id":"cac72df3-d98a-4078-a8e4-1c51ad67112e","resolution":{"observed_at":"2026-07-09T05:36:02.629457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14504","last_updated":"2024-08-24T07:40:22Z","snapshot_observed_at":"2026-07-06T19:06:10.813371Z","submitted_at":"2024-08-24T07:40:22Z","title":"Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes","version":1},"cited_work":{"arxiv_id":"2408.14504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14504","snapshot_observed_at":"2026-07-09T05:26:02.132005Z","title":"Is functional correctness enough to evaluate code language models? exploring diversity of generated codes","venue":"cs.SE","work_id":"3349e5b9-a9dc-4ea6-9193-fe484abb2a31","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2408.14504","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:1d4a8b23da3a55e8f6ae1dc71ee313ec3659401285835ce3bac0042e54f59fb5","observation_id":"b4b288dc-4b9e-4073-bd4b-64da2a3d7d92","resolution":{"observed_at":"2026-07-09T05:26:02.133748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.641960Z","title":"ACM Sigplan Notices , volume=","venue":null,"work_id":"53286cc2-dd30-4e9a-9f1c-f9d73a5924b8","year":2009},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:fb3a9586c9c2874afa80e1686e1a1df23bb8482a4516bf845de98d6f0d912f2b","observation_id":"b6792b08-cc59-40e8-bedd-e0c0deab4fb0","resolution":{"observed_at":"2026-07-09T05:36:02.645017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.655033Z","title":"ACM SIGPLAN Notices , volume=","venue":null,"work_id":"35273b71-50fa-4e6d-8dea-8414769991fc","year":2007},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:ad1637fd84ce8b7b486d3ffab1beb962588a3d4e450715e28152ee63b231d5d6","observation_id":"e544fd1b-0ea2-4ed6-95f3-3c842f4804c7","resolution":{"observed_at":"2026-07-09T05:36:02.656462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.607761Z","title":"ACM SIGARCH Computer Architecture News , volume=","venue":null,"work_id":"8a686798-6afb-4e77-bb01-dad970304504","year":2013},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:3a917073c012c8a029ede56f109a6d6d8bfa6af179f0707a0647414a27f9bfa2","observation_id":"7c261bed-8a12-4839-bacf-c4da5422c85a","resolution":{"observed_at":"2026-07-09T05:36:02.609232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06450","last_updated":"2024-08-12T18:59:13Z","snapshot_observed_at":"2026-07-06T18:59:51.988540Z","submitted_at":"2024-08-12T18:59:13Z","title":"Evaluating Language Models for Efficient Code Generation","version":1},"cited_work":{"arxiv_id":"2408.06450","doi":"10.48550/arxiv.2408.06450","metadata_source":"pith","pith_arxiv_id":"2408.06450","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Evaluating language models for efficient code generation","venue":"cs.SE","work_id":"09560849-dba2-488c-9af2-3ca599c7f32f","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"cited_paper":"/paper/2408.06450","citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:513a130aaa027e0cea090f915ab28c5d87ae3454b9788481da612f105b651210","observation_id":"2c284cb9-cfad-49e7-a13b-aa1c28eee140","resolution":{"observed_at":"2026-07-09T05:26:01.186731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:02.567653Z","title":null,"venue":null,"work_id":"469ea475-759d-4569-a915-13d3f7aa4de1","year":2024},"citing_paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-09T05:16:58.549058Z"},"links":{"citing_paper":"/paper/2607.07619"},"observation_digest":"sha256:adf379503570343325eaad994816e72b183be213475f8c74175e786c039ee206","observation_id":"ef2278a7-81c0-4b47-b429-ec0ac5164477","resolution":{"observed_at":"2026-07-09T05:36:02.569738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07619","last_updated":"2026-07-08T16:36:03Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-11T23:20:17.026913Z","submitted_at":"2026-07-08T16:36:03Z","title":"Rethinking Code Performance Benchmarks for LLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":10,"verified_exact":23,"verified_fuzzy":56},"total_outbound_references":161},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"thesis":"As of 31 July 2026, this Paper Citation Record lists 100 of 161 outbound references and 0 inbound Pith citation observations for arXiv:2607.07619."}