Pith. sign in

Paper Citation Record · LEDGER

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

As of 19 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 84 inbound Pith citation observations for arXiv:2305.01210.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2305.01210 v3

Coverage vector

measured 76 of 76 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-14T02:04:17.888553Z

measured 160 of 160 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 84 of 84 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:33:32.556943Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

76 of 76 outbound references displayed

  • verified exact14
  • verified fuzzy31
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

173
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation f73be170-7431-4faa-88aa-b52f8eecb123 · outbound

This paper cites Ahmed and P.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Ahmed and P

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.249862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:124050841d5454f93b6f93e1c2c779bec469c5b816711d96f5065e27f5eeaa15

Observation 949efa0e-16cf-4f29-b64c-dedd88bdc79c · outbound

This paper cites SantaCoder: don't reach for the stars!.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation SantaCoder: don't reach for the stars!

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.938020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:491a43566c0cbb519a2b72faeca5e1fd16edc6850d1765592b37787a73a0eb43

Observation 70d2ca6d-ab75-4ac0-9be2-d1ce9c2416c6 · outbound

This paper cites Austin, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Austin, A

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.286404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:4ba9a2c35e667d4e132aed4fafdfc0be3065bda517b423888050fa93387333d2

Observation fac0f6ae-5cee-4951-8239-75706a60ae9e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.289530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c7e93d883494afb48b19f9f48ff7ac944a67173c3a4b7aaa199083a2f46c2ec2

Observation 0688b73b-8ed6-4c6e-81fd-5e830ebde207 · outbound

This paper cites Black, L.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Black, L

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.293002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:860ae00fb2fbb8de10d356bf567329521b2c74ff811c31cab12fbf81e944c5d1

Observation 7f8acf35-d4fc-4f5e-9279-5d44ed6256c9 · outbound

This paper cites Brown, B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Brown, B

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.300747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:3dedf7ddaf3467c6a67292f8835ee072ec05eb5e3341125bb9c55a53e6bf7cd1

Observation 411e5b4e-02c1-4a32-b650-e4c0d593166c · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.304288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1c38f725f5af16535fa8cd8fbfd196ce5fec24cc4832994a837f7aa691ad4686

Observation 43dbb854-6b83-4772-8695-6313582d45d7 · outbound

This paper cites Cadar, D.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Cadar, D

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.307765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ad72bc0606a1f99d59b1e556bb0073570d43025b810099818cf50b2234d2c636

Observation ea0550b9-7865-43a5-a0ee-027f55684d79 · outbound

This paper cites Cassano, J.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Cassano, J

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.311374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:94fa13e68a47d7d76c83386cd6657681740fcfd56b583e9653d16caa4a685f11

Observation 01893e90-e026-4c1f-b113-5d141122aa4e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.314674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:74337a38ca7042452dc2f8b674c12064f1cdb4bc9ac01590a2451bec8d9b5a91

Observation 5f0de9db-4d67-41a8-ad68-edb9b52b77f3 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Evaluating Large Language Models Trained on Code

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:17.959701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:cc74112d0c44d57d72a839cbabe3cc589ece951c2d615bbc67108f96728aabbe

Observation 36f78d3c-1be9-46c8-a7f6-4e08ba570ced · outbound

This paper cites Chiang, Z.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Chiang, Z

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.327981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:bb6f1bcc0422ac13f7881d00ffae4480fc85ab7d2b8ab1b5dd4da789f0bed01a

Observation c5c7688c-859a-4e68-bd0f-83cb82f2e8f8 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.331053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:36b949d557b20109856c2807b60ac65c09abb307ef2723d351af987134b6ef47

Observation 6bdc79ea-ee1a-4ff4-a742-b67b9cc0f4ae · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.335212Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:007e23d582dcafd263c273239d7f829a3386b84b5d61ef4e00c22191abfc5747

Observation 66279dc6-8d9f-4679-bc48-798242d23d7f · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.339909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:f48fe662f35c14ee79c21cb9990a4fc09007997aa50d2c4c11b88435a718616c

Observation 4b45ab5c-057b-4993-a08d-37c75e5acccc · outbound

This paper cites Fauxpilot: an open-source alternative to github copilot server.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Fauxpilot: an open-source alternative to github copilot server

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.345772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9fa39fc0de90dd62c8918a9b5e98950daca07be9e8ec5c83f4bb67dcc953db48

Observation 29418d9f-fc37-4661-aef5-bccfcfe1939a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.035645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:0308a6c4ed04720986da365945a3ce1243c56bb5e3182bd980b79ec84d890cc6

Observation 8968cd5d-a183-49fc-b36d-d7db459f9be1 · outbound

This paper cites Fried, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Fried, A

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.041895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:14c4915096ed83edf291a392ff7a03db22eab1b0610d275a394079fec04a72b6

Observation 17cd2fbb-21c7-4c07-9348-11938d4ad6a0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.047446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:785c7701602fea9f64e9d2f2296d7bea60276f47ca94cc470f57e5543fbe971f

Observation 2079d139-fe79-4d00-a935-0d345e139e9e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.053673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c11ee28cc02ac7d90ad79684b3ac3b75d1e249b94178957d475c9d5c891ddee6

Observation 8bf1ae76-8faf-42f3-93c1-65f71d1bbdc3 · outbound

This paper cites Gulwani, O.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Gulwani, O

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.063338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6815b3da833fd8fb67f47b300c3663196e434eab5106ae5e47bbb6e83ad6faa5

Observation f77f2e7b-9911-4a06-a377-9c55202ed60a · outbound

This paper cites Hastie, R.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Hastie, R

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.070028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:649cd0eab7ced7ee93520b5fcb34404306d7bb0188b0b85a14067e3cdde8beeb

Observation 34ce07cf-2573-4151-be96-42a863889e1e · outbound

This paper cites Holler, K.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Holler, K

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.074605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6ecb539512f6516d1e193727131e58b14f721d1b0664a1bd3c2ea097c02bd415

Observation a300eaed-3f09-4678-b30b-65804bf3c580 · outbound

This paper cites Ivankovi´c, G.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Ivankovi´c, G

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.079390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:5301bd1c331fcee54afc4f20ebbb3b293efe4b938fa9dd8a5bc20df25cf37cf8

Observation 374ce154-fb10-42bb-b507-37bce2261277 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.085043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:5034d36f9c0a1f2603137881c8b82150be438e2bbeba3c30e2339ce3a7738504

Observation 4aa24f72-6b1a-445c-b36c-9ce893a23b34 · outbound

This paper cites Mistral 7B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Mistral 7B

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.001948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:838bcac13a1cab82ef28bd965e9dcd497b8ad63ce9398b773116be981f288549

Observation 52af1a6e-2121-430d-a47c-0b8f3c53b5c5 · outbound

This paper cites Impact of Code Language Models on Automated Program Repair.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Impact of Code Language Models on Automated Program Repair

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.014273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:68c7bfc205a602abbe4a0516855611fb7c43032f872a8276eb26e2d67826a2e0

Observation 7fa4371e-4c3f-46e5-a8dc-7876d2ecd440 · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.022396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ffb4b2400ae927f5a701beda8c29983e4dc372d2972c075b6d45cefe5dd66902

Observation d50fb4ef-afc7-441a-b004-ef92a7df5e61 · outbound

This paper cites Kalyan, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Kalyan, A

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.090978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ca0106daed585c460dc2bddb62315d46ed813b57a9270bfb6920a33851e6a43d

Observation a3138b82-c67c-4e3a-8cf7-da1edda36ac4 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.098983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d7a0d476aa585afe4c9f2200846f1c618b41f0105726064f05117f8f188751da

Observation 4d310cd3-2c37-4d00-ad59-73124943232f · outbound

This paper cites Unsupervised Translation of Programming Languages.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unsupervised Translation of Programming Languages

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.993427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:82187acdc72acd6ae3a4cc7906aecadd240144b43e6d1779447965a80a46c327

Observation f2eb8f01-4c65-49f9-8673-f388a46ee0a1 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.103730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8a86a942364fa1b80df334de3f0b5e0cb4e4d66820866724f8d263656749e2f8

Observation abdb1ea0-c616-46ad-9db3-5c4ca40bf96e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.111346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:a1435f91c747834a402f18a5678d0475e4974bb14e48ecc8ae3abb2c74e3a577

Observation b63a7451-52dc-41e6-83b4-9eb99978cbc0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.119161Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:e80c442a9c14ab84de5d5dc09799bd73a17099a8858a170bd0279eba40490127

Observation fa1da41f-c754-45e3-b78e-19fa62da4acd · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.122573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:055f5ba9d84f01ecf4db6538f2089fac0096eb50cbda67434689b20c8d2979b0

Observation 533ad619-2372-445d-9a43-8a88f4d15829 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.126476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c7ff12696b3da134072d3010ff152ca41d5a960bacd1c800dddbd4e6b29c049d

Observation 7a53ef94-3f67-47df-92ed-c82981612337 · outbound

This paper cites CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-15T11:40:02.914862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:0520cc75f792ae2e23c14f9d98d7c6e0a345c5907e4f189d0eff6ecda67f0677

Observation ead87ab5-6cef-4d53-b7bf-5df8003dabef · outbound

This paper cites WizardCoder: Empowering Code Large Language Models with Evol-Instruct.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation WizardCoder: Empowering Code Large Language Models with Evol-Instruct

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.985483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8cfdcd6d6b41a134a37df4b9b46228d294b16f9eb590773020a1c9243136ae92

Observation a455a752-73ee-4ac4-9d80-ce0a39234467 · outbound

This paper cites Manna and R.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Manna and R

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.133825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:98ae17a93ccbbfc898b89c5c11c8d6b540dfd58c5e4594fec97b833198854112

Observation 76fba8f1-d798-4456-b4db-f133d7123aae · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.137223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:a4da9587bf7cb6482039e5caf617aa6ea119adee3c0fdf0df8fee9ebeaf728d9

Observation e80156be-262b-4f1b-a0d4-07973268d354 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.140516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1b39fe41475866d7e1eb81f5e48a23c261ef7f3907edc13edc31e3503845328b

Observation 8ead5d23-3592-446d-b850-e9da13ab7789 · outbound

This paper cites GitHub Copilot – Your AI pair programmer.https://github.com/features/ copilot.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation GitHub Copilot – Your AI pair programmer.https://github.com/features/ copilot

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.148026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:095e4179685708ddb4ef89beabe07605f52c02496c7d9b1aa14f37d3a55a1389

Observation aedbf686-24cf-4ad2-8502-7294825cabc7 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.152202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:fc4afe552d1056d7270ad48ade1cf679e70c5253ebe87c63589b387dc7ae9c91

Observation ef70036b-a4bf-4258-b343-424e609f5e13 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.156502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1efd18d8a40c2edea693fa082c85dcd158227db07de01e832c5156b577d2ef43

Observation 8f23dfe8-7248-4f46-b55e-a2a9997199b8 · outbound

This paper cites Nijkamp, H.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Nijkamp, H

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.160859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:41e52db31a1ed6d05c479066f21fa40d6b5c43f7560afb86ba1f83bc67258b1c

Observation 4a8e6c2e-4908-4822-81ac-cf845dfebda4 · outbound

This paper cites Nijkamp, B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Nijkamp, B

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.165155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:adc69e7b2992dafeee43e287d6e9b2c9e078904235c90948fd129a1262001da7

Observation 67422d45-fd7e-47af-a57b-adc9fa271af0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.169828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:85feef2fd02b6bbc4ac312d412324b00a45a02d5e2d03fca52d76e1f2d54ce34

Observation e05f6857-6be3-4c99-aced-2f4ff5990bba · outbound

This paper cites Chatgpt: Optimizing language models for dialogue.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Chatgpt: Optimizing language models for dialogue

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.177498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ba0a8748f4d2c6603d8229b5e9a55c2d911947b0582b5d81aecb2d03a9f989c4

Observation 58ebfbde-dbc7-4b54-a72b-44d0d3b610a5 · outbound

This paper cites GPT-4 Technical Report.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation GPT-4 Technical Report

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.008192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9eae655fbbb5df58d3061c5f22afe6db4571ac74b3d6f52ad90f659c2f99e94d

Observation 040cdad9-9fc2-422a-9fd0-fd3612114024 · outbound

This paper cites Papineni, S.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Papineni, S

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.185652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c4b08c3116af919ff080ef242cd74d4ba39991a45154089f444aa6622b309da3

Observation ad4371e0-fe75-4b4e-9e25-bf9fcc182a95 · outbound

This paper cites Petrovi´c and M.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Petrovi´c and M

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.195769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c876b806fccca2fc765c8136df932ab963bcec7b7e26a09c1e9e16e9ab79e1b1

Observation 54038b96-f9c8-4450-8fff-fd9f12c5d017 · outbound

This paper cites Phind/phind-codellama-34b-v2 · hugging face.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Phind/phind-codellama-34b-v2 · hugging face

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.201717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c315ea2f25af94757223f0f3eb4109d7ffe75936a285a53de14a62ab05256d85

Observation 1d12a269-ae13-4c0c-ad3c-04cbe961407a · outbound

This paper cites Rothermel, M.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Rothermel, M

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.205944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9ff6e0d6460398ebe6e8075eb861e6344e9b70c03f0b2236da430bfd336a799c

Observation 1387f375-fb63-43f5-8064-f47684925b52 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Code Llama: Open Foundation Models for Code

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:17.969215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:a033b0cde09d8bc2630da99456abe167c63f81d71e6543431c8f526cc8036294

Observation 5a2bcf3d-6b40-411b-8ea3-814661c43b0c · outbound

This paper cites Leveraging Automated Unit Tests for Unsupervised Code Translation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Leveraging Automated Unit Tests for Unsupervised Code Translation

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.974075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:85841104c84990e5f3100279e02921fb6e6e2891c5f391b42d8f301b3f0097e8

Observation f5d5f0c2-5bd9-4b0d-8fd5-d3ff6942ddd0 · outbound

This paper cites Security.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Security

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.210368Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:2cad886d96ae85a2eee2eeb683159bd3279ae8365dcc3a9924d6aa0bb54e782c

Observation b62d1faa-3079-47d2-8881-6702e46e8d30 · outbound

This paper cites Serebryany.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Serebryany

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.215961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:e35f7cb3b2768c099d983b4e6de349287b39dc6f72cb0d4a7fa6700824bc4fa4

Observation 0cff1382-c898-490f-95a9-fff5ccdc35bd · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.220422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:93a9f904945ae27542a94d9e9968186305566c678147af42546fce71db44ad51

Observation 817e2ba6-0bba-4ea7-9805-21c1afc5832c · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.224667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9e9a6e6cf5e109c43a44a70722aa397f61bfc7e6315f534f1c19b37ac0a51711

Observation 5490c333-f08a-47f3-9cca-26a3264b47b5 · outbound

This paper cites Stablelm: Stability ai language models.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Stablelm: Stability ai language models

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.229138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d5e6f4381f69dd65b6ccb54fd25d10a9ba71be66a3d9371c4ccf1d564f9d148e

Observation 63630815-ccf0-4f45-9534-cc7b27b0265c · outbound

This paper cites Vaswani, N.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Vaswani, N

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.233368Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9bd7073c98662ce1c819496953a4181a47c0ad91b2597769bc17cd1feea02681

Observation c1ebfdb5-bd0e-4dcf-af14-1cb47f90cca0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.237637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:28f6999aaff084a49dcc5ed4b65597038e12649ef8b3f585f35c8fa891ef83b6

Observation f37ade9c-ef78-4a70-aa7b-e39b36609806 · outbound

This paper cites Wang and A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Wang and A

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.242502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1222cd95f4799fb93fedd99ac77d21b90383851c18e3e088f977ca5e3e537114

Observation c70a20bf-4ed4-4542-bb05-5808f9ce5db1 · outbound

This paper cites CodeT5+: Open Code Large Language Models for Code Understanding and Generation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeT5+: Open Code Large Language Models for Code Understanding and Generation

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-19T05:26:57.653334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:f08691252d05c7ec99dea9a994cb1117a1e06b09af7212e0521d5e4936894778

Observation 9a793f47-af67-4557-a227-e3b203b221aa · outbound

This paper cites Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.952242Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:b8b2cc3ef0f8ee7f900fe544ed404016dce65362f7b75ccf80e8d7ca0e940e55

Observation 784f48b6-3d7b-4b9a-b472-0205e3d903ec · outbound

This paper cites Winterer, C.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Winterer, C

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.246481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:b9b7e82879f3911e05f8fa06f2b258c174934804da4291b62d7c95c09d616eee

Observation 6a6e265a-f2af-44c1-aed0-82c85a5278ee · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.283210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:afde8edcbfb8f046eaa36ed662ed68c80f4485a075372290a8242a24ce2cfd0d

Observation 27e9f268-6416-4047-bc48-15e164fd257a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.252923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6dd7a4f8fc4f5cfbcfb48fc364c2806873e96f7f0f6693f6b576e016e4254180

Observation ea49175e-f8a9-46ab-8c8b-1023615d799a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 69

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.258639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:42dc52cb95f2dd2da9f463e8cbcabbf25ef7640f3742a1028ecba902ee8ee47b

Observation 4bf61302-0235-4e49-8dcb-f6d2012d1ee9 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.262350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8be631cd48ccc1414aa0338880bc9b095190f9885441462b785aa7ae1f581d93

Observation 50822c0d-70fe-4389-bb61-6356562a4a54 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.265396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:cec6cfbeb126e27bd5f5a2568ee8c415da0748c0b7948cbc3edd53efb25e0878

Observation 6ee73def-f8a7-4677-94b6-bebeee093b52 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 72

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.268788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:7cfa8ef738e792ed1b2cfae44784dc08c51b826ff42b957f7042cf845664cd5a

Observation be4a29fd-3edd-442e-bc5a-dbe64d19da9d · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 73

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.272073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:53d1ec006ece8f55ba497c5731846bf7dbe9c4711adb969c50921fac6f88dbcc

Observation 79cac963-d3db-4feb-bd5f-bf1526b40968 · outbound

This paper cites Zalewski.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Zalewski

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.275719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ce2b818532a4fabc9763faa3f41f66648743ae58c62d84f5e005edc7eb681ac4

Observation a0df4eec-d2b2-43a5-baec-d2e5856d21a6 · outbound

This paper cites Zhang, D.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Zhang, D

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.279191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:66808bd9f62417c752e8b10fba4dd18e4f731b338db0a66c657410045c11f3ec

Observation d065e01f-19e0-4044-a0f1-5b1be68a83b1 · outbound

This paper cites CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.031433Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:55eb6d635858607e0e92a4b8b8a2f10af31730b42dad06b2b49c0974431fd023

Pith citing papers

Observation 40aaa769-da10-494f-a81a-6b6d410f0289 · inbound

CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society cites this paper.

CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 69

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T01:40:53.351795Z digest=sha256:15aa29a1e623b0431a2efd01382d27d923742408d02178a32c0f48fa3cdc33ac

Observation 48975998-ef2f-4736-aa69-c3289948a757 · inbound

StarCoder: may the source be with you! cites this paper.

StarCoder: may the source be with you! Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 289

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T23:32:59.517389Z digest=sha256:cf5c1757d98da3518ede2ba415dfc06d53cfc57b41c737cb65696746eefefb62

Observation c1862457-8bd6-468d-9b75-9c5425455271 · inbound

Textbooks Are All You Need cites this paper.

Textbooks Are All You Need Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-13T04:44:03.148223Z digest=sha256:affff22e3a6a3fff3723a06ffe5e5f899a8de2918c31d63e3a5146cb732c7a3d

Observation eb0386ec-8d79-42f0-ac77-d3e6558a12d4 · inbound

A Survey of Hallucination in Large Foundation Models cites this paper.

A Survey of Hallucination in Large Foundation Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 81

Resolution
metadata mismatch
local_arxiv, observed 2026-05-16T15:21:00.858962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-16T15:21:00.778049Z digest=sha256:e53c6a0ad0e5f7f7e2020b324c847db099d56ee9915f41ac498433d380866734

Observation 9d2f60b4-ba28-4982-946b-1f55c3023fda · inbound

SWE-bench: Can Language Models Resolve Real-World GitHub Issues? cites this paper.

SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 113

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T14:02:01.201111Z digest=sha256:7344252f054de8f47b524e3d26c79808a28591cee9b85ce4d2d79982eea17cee

Observation 5a6e1e36-c4e9-4760-a5ae-00f9de4c00e7 · inbound

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code cites this paper.

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 277

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T17:34:42.565806Z digest=sha256:4f1fc866f9baa6de4a48def931abcb185087a6c4017e7c339cd79bd7989671d0

Observation 11e163e2-c1d4-4f87-ab0b-4667e551c619 · inbound

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering cites this paper.

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-11T12:45:34.286368Z digest=sha256:9c63627331cebed76fa7b93b4ab44daa2a6b33fe92b8da98c6849a0f2b989a7f

Observation 2823812c-0453-4f46-9102-f4e39bdd050b · inbound

CKGFuzzer: LLM-Based Fuzz Driver Generation Enhanced By Code Knowledge Graph cites this paper.

CKGFuzzer: LLM-Based Fuzz Driver Generation Enhanced By Code Knowledge Graph Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T18:29:12.682581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T18:29:12.682581Z digest=sha256:cc2cf046978a118919c38f611c68baa6c3d3aba24bdc9a2e141a5c2c824b4195

Observation aeee4a21-b652-480b-84f4-7b83850abae1 · inbound

Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks cites this paper.

Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T12:28:14.350125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T12:28:14.350125Z digest=sha256:de20bc831b9216205f6abdff17db9492c7f108345fc9c2161feda3c5c506bdca

Observation 2f2718c9-2249-4d5a-9e4b-11728ad13b08 · inbound

The Performance of the LSTM-based Code Generated by Large Language Models (LLMs) in Forecasting Time Series Data cites this paper.

The Performance of the LSTM-based Code Generated by Large Language Models (LLMs) in Forecasting Time Series Data Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T10:59:32.298932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T10:59:32.298932Z digest=sha256:15c92c31d91af03a5f40ef452a7da80237f4716f65c208f3209b2bbd0df5ea40

Observation f5a02bc2-4a00-48d0-bf54-8db435290e06 · inbound

From Words to Workflows: Automating Business Processes cites this paper.

From Words to Workflows: Automating Business Processes Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T22:27:10.711089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T22:27:10.711089Z digest=sha256:20dbef9217c1897fba1b3d6e22eaeb924a8583e8f3c6f7e11eb4b7270eb9df4a

Observation e8def883-2059-4f73-a6af-c69079440866 · inbound

Evaluating and Aligning CodeLLMs on Human Preference cites this paper.

Evaluating and Aligning CodeLLMs on Human Preference Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T20:53:15.275881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T20:53:15.275881Z digest=sha256:2ae020db9bd87e8fdf71873ab54bd4ec54820d24c7fd8c393da6a6d02e565670

Observation ecdb8613-ee29-4043-9fc7-c8d499b8dcf2 · inbound

Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar cites this paper.

Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:26.666546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:26.666546Z digest=sha256:dbc2755a043e93a6b1fe6e99fd6675e3a103eb3e173ffff64113376328e9632a

Observation 8089aeac-cd8f-4762-bc41-d086fbdce08d · inbound

ExecRepoBench: Multi-level Executable Code Completion Evaluation cites this paper.

ExecRepoBench: Multi-level Executable Code Completion Evaluation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T14:27:05.650690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T14:27:05.650690Z digest=sha256:f00ec4d4be28afced21f5c684c9646c3d4b97bae55962124ffb5599dcaba0c38

Observation e019d461-189d-42f9-a85d-d39da7808a20 · inbound

Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization cites this paper.

Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T04:56:22.405941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T04:56:22.405941Z digest=sha256:83e9e0acf553f678a2bb86ef94c68ccd989c154af40b6b33d4830084c3fe6365

Observation 8561b2e7-fb6d-4047-b59a-bbc745bf1f56 · inbound

Assessing Large Language Models in Comprehending and Verifying Concurrent Programs across Memory Models cites this paper.

Assessing Large Language Models in Comprehending and Verifying Concurrent Programs across Memory Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T15:19:35.791315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T15:19:35.791315Z digest=sha256:c1611e295a12470439c09cf76c611b9f242c5cb22fc3d8c2cf08fb9349b2149d

Observation acbc8a92-96c4-4918-9b37-85876b4b05a1 · inbound

Do LLMs Have Visualization Literacy? An Evaluation on Modified Visualizations to Test Generalization in Data Interpretation cites this paper.

Do LLMs Have Visualization Literacy? An Evaluation on Modified Visualizations to Test Generalization in Data Interpretation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T13:37:15.042880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T13:37:15.042880Z digest=sha256:089ebacf9a81cd56a6e4ca6a667c273f4a662816afd1ca220a6970fa3dfa53d0

Observation 92fc377b-b5d7-47d3-92a6-41e89904cb66 · inbound

CodeSCM: Causal Analysis for Multi-Modal Code Generation cites this paper.

CodeSCM: Causal Analysis for Multi-Modal Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-08T20:08:13.502210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T20:08:13.502210Z digest=sha256:5add87b95b4243b70832eaaaa32637d341805c6200400b4ec1d9d6a0c038a758

Observation fd5de2bb-c7be-4f87-bf34-5a3b69153488 · inbound

Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs cites this paper.

Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-11T22:22:27.455361Z digest=sha256:14fe160bb27f28af9e132d581fdb3ea67867d8c5a9abc8b333884b3501a318a1

Observation 8ff3787c-2972-4006-beb4-b892c5d5f118 · inbound

Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation cites this paper.

Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T12:33:32.556943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:33:32.556943Z digest=sha256:b9dc94e553c423ae3eb60f8a81d432b1885c827e62e27345680180cde9297f8a

Observation c88144e7-753b-411a-8ca8-5bb712fd6ed4 · inbound

LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs cites this paper.

LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T11:47:34.580790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:47:34.580790Z digest=sha256:4dd7a8713d6b2f4019fef475eeea1e4b8e1b11f6618336dadc20b9849f8d328c

Observation d5189f5a-5185-4301-8b8d-423e2fa96bad · inbound

Directed Greybox Fuzzing via Large Language Model cites this paper.

Directed Greybox Fuzzing via Large Language Model Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T23:56:02.510055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:56:02.510055Z digest=sha256:ab50fe2d0d89ba7654a0f11dadf66e6a4aaca2706818f2e949819b0687eb5514

Observation e25c6fda-9932-4fa8-a1d8-14274e922e93 · inbound

CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation cites this paper.

CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T21:22:19.144150Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T21:22:19.144150Z digest=sha256:65704e6dfbba35114065b9d0bf93ec177cba9799a83ee7ed2b2fe1178bf50a50

Observation 35c67f64-6292-436a-8fe4-c2f9b39bf465 · inbound

Are requirements really all you need? A case study of LLM-driven configuration code generation for automotive simulations cites this paper.

Are requirements really all you need? A case study of LLM-driven configuration code generation for automotive simulations Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:19:10.199450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:19:10.199450Z digest=sha256:f4ad441df85b83fb0c74c0855a6bc14ec02de3340f66708976f29e437a5b18bd

Observation 8543db75-23af-493a-83d7-435e3d5ef950 · inbound

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding cites this paper.

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:20:16.483017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:20:16.483017Z digest=sha256:8ab6794f87e0817be4cbb4dc0bd542d12dd24ab8fc1fde2bcebce6d989aeccf5

Observation 87d06d85-d232-48cf-8b08-7e612b513762 · inbound

HardTests: Synthesizing High-Quality Test Cases for LLM Coding cites this paper.

HardTests: Synthesizing High-Quality Test Cases for LLM Coding Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T12:39:56.781297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:39:56.781297Z digest=sha256:7a24f84f62232af0491b7095e85040affa83acb57f5c8f99f25452c186650935

Observation f91b6487-e940-4a96-915a-0d6f1ab6685d · inbound

SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner cites this paper.

SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:01:08.583838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:01:08.583838Z digest=sha256:ec2e70817aa334b1742e9028d6d0d7dcc68739ef1a76a94316ea15c6af1aa4fe

Observation 7225e502-4e22-4b42-8d75-dfaad8008844 · inbound

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure cites this paper.

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T00:59:56.261209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:59:56.261209Z digest=sha256:dfe2b2bd8a50ee1b1c813dbd43cf2b86842730e9c372791b233490ed6432d40c

Observation 4bba9f21-7284-434e-9af4-2ed79294735c · inbound

Essential-Web v1.0: 24T tokens of organized web data cites this paper.

Essential-Web v1.0: 24T tokens of organized web data Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:24:45.298601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:24:45.298601Z digest=sha256:faccf0b95ef8a74f8c60dbeb8bd71e0f455b3248f3c98283150ee5a5da3316f1

Observation 6282e203-731d-4d3b-b0d2-f2945b65393e · inbound

Mercury: Ultra-Fast Language Models Based on Diffusion cites this paper.

Mercury: Ultra-Fast Language Models Based on Diffusion Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-05-17T02:05:18.905965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-17T02:05:18.834924Z digest=sha256:c8fec9b3a9cc19b980d1cece521180949e399bc6af34482075e820761ea868d2

Observation 74ff57c7-988d-4879-8a1a-4999167ea8b0 · inbound

LLMCup: Ranking-Enhanced Comment Updating with LLMs cites this paper.

LLMCup: Ranking-Enhanced Comment Updating with LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T18:19:58.328528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:19:58.328528Z digest=sha256:d2772514b807b42e7bbb18f561a0c2ab31db006d94cf2152d6cfd68e21e0af74

Observation 8163ac81-d03e-43bf-affc-011acb364d10 · inbound

Multilingual Multimodal Software Developer for Code Generation cites this paper.

Multilingual Multimodal Software Developer for Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T18:18:54.652860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:18:54.652860Z digest=sha256:f5f192191b51fc21028e14f9cd25b576dcc20bbb2745d35f7c513d3e94619228

Observation 4b2d5467-08b1-46de-a601-caeb83715c05 · inbound

Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey cites this paper.

Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 109

Resolution
unresolved
no resolver link, observed 2026-08-06T17:54:17.252756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:54:17.252756Z digest=sha256:e00835413c5681f78109348a270b629803525b9e437b420106c7db3e43fba6de

Observation 5033f586-a176-4f67-ab6b-e7c12760a395 · inbound

Investigating Training Data Detection in AI Coders cites this paper.

Investigating Training Data Detection in AI Coders Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T14:51:53.788650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:51:53.788650Z digest=sha256:78998357d6fb75d1bde60e9ea07e97fd855dc5a5c96e7b04938c0a648bb38cc1

Observation 497518e2-25eb-4892-865f-9fec03203f29 · inbound

Technical Report of TeleChat2, TeleChat2.5 and T1 cites this paper.

Technical Report of TeleChat2, TeleChat2.5 and T1 Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T14:43:22.362379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T14:43:22.362379Z digest=sha256:7f3d2919f2aeedf71a0c23604a3b0db486c054d3631c5ebff4fa1fee727b596e

Observation e4d4cff7-bc60-480a-b542-f557db50255e · inbound

IFEvalCode: Controlled Code Generation cites this paper.

IFEvalCode: Controlled Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T11:44:34.011164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:44:34.011164Z digest=sha256:5ca0f13e6454f8554c920a4ac4cf8d2d52cb3c4843928b82d620b424f8e1525a

Observation 2b7f693b-3821-4027-8715-437ead5f5ccc · inbound

NVIDIA Nemotron 3: Efficient and Open Intelligence cites this paper.

NVIDIA Nemotron 3: Efficient and Open Intelligence Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 104

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T01:40:42.541794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-18T01:40:42.190369Z digest=sha256:6b3db37986de47cd38f8cd58e4fe38f7cead048a4fda870dd93f3bf9aa21a6e6

Observation 1084df84-7ec8-49a2-9561-8a9106c465bd · inbound

Ensemble-Based Uncertainty Estimation for Code Correctness Estimation cites this paper.

Ensemble-Based Uncertainty Estimation for Code Correctness Estimation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-14T22:53:14.056575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T22:52:58.524934Z digest=sha256:9ce1dab0d441843738279c14704931115c5e4fc32db42f19503453d6e1877f99

Observation 3b19f78c-15fc-4996-8f17-100d027cf72e · inbound

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping cites this paper.

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T16:35:33.392202Z digest=sha256:f7f78afc6295e494008bae9c1571f4a28644608a16b271a36b28399fa475dde6

Observation 218a1ff0-f3c8-40de-a319-a1d625c43278 · inbound

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation cites this paper.

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T15:44:50.762366Z digest=sha256:eadf0cf10a4023f997f5b69d6b31f6c632a0a487d838e59f60f105e3af4cdbec

Observation a41a87fa-1cce-4152-b285-44bacb6a7aed · inbound

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation cites this paper.

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T00:19:57.865123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:19:57.865123Z digest=sha256:ab3173c9bcf393b7c7b5fa0269b95e9aa1d59752e018037ab1d58c8dd85f9d0a

Observation a343b8f7-60d1-4bcd-bb72-1bbee37aa1fe · inbound

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review cites this paper.

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-15T19:56:33.755930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-15T19:52:49.324500Z digest=sha256:58a2699f1b9bae8295f118dcd6233dc88297769f7c7ca3af5e23ef3722c9627d

Observation 5cb5290e-be05-415e-b994-b43b142f8936 · inbound

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts cites this paper.

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T05:52:28.822723Z digest=sha256:9992a6cc516f48c1ff7ae78dd1414d400c9ca7f7594702d6cd7dfb15482e720e

Observation 3f084246-e86a-43b0-ab80-84f920b33324 · inbound

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation cites this paper.

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T04:21:39.637962Z digest=sha256:86c97eeaaa165989b094311f6b6445adc904fa25699895ba66bce1ec289bfa0d

Observation 8d6e07d3-3929-444d-82fe-9ce2d533683b · inbound

You Don't Need Public Tests to Generate Correct Code cites this paper.

You Don't Need Public Tests to Generate Correct Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-09T20:57:43.802195Z digest=sha256:63e1bc67222da9783bd3570945b1facb45603cc42faa68fd047d910953cf55f7

Observation 5b0dd6e1-4b21-4614-ae54-72b8f8930637 · inbound

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis cites this paper.

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-08T03:07:06.924437Z digest=sha256:7a94cadec90d764f88909ea7e90e08ffabcd3ab8c93330141f171f27ca6d0d68

Observation d8d67c4e-06f9-43ed-b96a-70a287891fd9 · inbound

When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation cites this paper.

When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-08T03:00:26.137401Z digest=sha256:9f6dd7fdff0c3134c599128e06e6f06a6d4226ab4fe8d475badd54ef68bfa89f

Observation 4ec36916-308f-4f35-8a14-a51ea3e590a6 · inbound

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation cites this paper.

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-07T10:33:28.276228Z digest=sha256:2ed7e75938bb7aed4848773876e96bd818e0d8d4b168a91ca2b3502c251301af

Observation 32612799-a066-49b0-b250-2d8d92b0940e · inbound

ProgramBench: Can Language Models Rebuild Programs From Scratch? cites this paper.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:b7861b877955d40602733f6e574190e69929f0c01493fc60c130b2399fb09578

Observation e9240e43-6025-4883-aef6-1fe98f3715d6 · inbound

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code cites this paper.

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 71

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-08T17:37:51.790000Z digest=sha256:cbee685cd68f6d88ba4085705e5f0e5d352eb7609f502a6c5b88c5d49d3fadd3

Observation 4423ff8d-f199-4bb1-bfff-6be961c09317 · inbound

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training cites this paper.

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-12T03:34:10.370956Z digest=sha256:069b82925a5fd3ced2a2916cd95c7168936f8b0844615b983e9e7d59f9365484

Observation d9bcabbb-4713-4817-b8ce-183363f209e4 · inbound

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training cites this paper.

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-05-20T23:23:51.285678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-20T23:22:51.808346Z digest=sha256:2f0b6162977a5f16a7c02acd9415a37c8304f84359680dac903265769a1fe23b

Observation 760705ac-573d-4fe2-baa0-39f883d84a80 · inbound

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation cites this paper.

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-12T02:07:49.789835Z digest=sha256:d05b778cfbce7929fcfbbb159b4f23629e9c3b9a36e36046c2b5d5e5b350f925

Observation 8aefd51a-7419-46f4-8b6e-86b02e2f5293 · inbound

Evaluating LLM-Generated Code: A Benchmark and Developer Study cites this paper.

Evaluating LLM-Generated Code: A Benchmark and Developer Study Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-12T02:27:11.573347Z digest=sha256:96f63cd0ccba4b6ed68ad1f7cbceefd5cc58b84641e7a29c96e8a29a0e5a5e94

Observation cacf0642-5b7b-4c18-9d8d-cc6fc6eec3a1 · inbound

Evaluating LLM-Generated Code: A Benchmark and Developer Study cites this paper.

Evaluating LLM-Generated Code: A Benchmark and Developer Study Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-01T13:35:46.788186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T22:55:49.377456Z digest=sha256:b4f917d44476572f6447ead3772e425483bb5103bba277ce8d4e695e6743e832

Observation 3cdb55f6-0bde-4d7e-b438-2ebdf4116c63 · inbound

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation cites this paper.

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-12T03:12:49.428954Z digest=sha256:27ede6e04ffdb294e44c771c9729788c8b8ac9825f449099af99dd571236e47f

Observation f62d2ac0-7294-439d-9d67-3408ef4d6fcc · inbound

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation cites this paper.

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T10:11:22.819039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-22T10:10:14.565995Z digest=sha256:540de7aadf4cf0c343513a8b20acdc57cf6d665ce70323ed76ad0a960f280f98

Observation e5b40be9-fd56-473e-914c-dc4bdcfcb9ff · inbound

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution cites this paper.

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-05-19T16:32:39.498041Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-19T16:28:23.113976Z digest=sha256:56160e4c25c9b4d55f5d8e91ca22b83ba181a2751dbb0c067de432cded2d42f4

Observation bcc93a67-bab7-4d9f-8068-85a5a2621b86 · inbound

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning cites this paper.

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-20T13:18:18.484837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-20T13:13:51.081597Z digest=sha256:fc4cc6093a603dd3b3e7ae97c516649487aa29d6ad2abfae423ca2f58431b277

Observation c7bf2feb-010f-4fb2-927d-d630c7e32d9c · inbound

Hide to Guide: Learning via Semantic Masking cites this paper.

Hide to Guide: Learning via Semantic Masking Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-06-30T12:24:40.021889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T12:16:12.108715Z digest=sha256:2dd20dd5521f03f87dd438782c2c4ce34da6c6d11c95442957f686e0a2470d1c

Observation 17f86524-7e07-495f-b44c-ccf06ace390b · inbound

Efficient Benchmarking Is Just Feature Selection and Multiple Regression cites this paper.

Efficient Benchmarking Is Just Feature Selection and Multiple Regression Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-06-30T00:24:05.147871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-29T20:20:15.314971Z digest=sha256:0ce08eb5cdd5fc9dd80fb20d7c28250131bb61db4fa71beb403aacdc5979bd50

Observation 25a591e1-839c-457b-8a2c-5f4f3c417a3f · inbound

Mellum2 Technical Report cites this paper.

Mellum2 Technical Report Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:02:46.558336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T22:58:35.397914Z digest=sha256:bd8570ec6993ca738c0ea095265b0d66d7f2c3a529b3bab530fe97ceaf4ad431

Observation fc6dd5e8-dcb0-4ed7-9f18-1d229776522b · inbound

Before the Model Learns the Bug:Fuzzing RLVR Verifiers cites this paper.

Before the Model Learns the Bug:Fuzzing RLVR Verifiers Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-01T20:46:13.789220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T17:45:28.461939Z digest=sha256:1e63da0c6c1db8d7e246d3f2baddc80334ef1216e444078f3100aecaeef08a54

Observation c04cad1e-f21f-4203-b121-d643ecf823ce · inbound

What makes a harness a harness: necessary and sufficient conditions for an agent harness cites this paper.

What makes a harness a harness: necessary and sufficient conditions for an agent harness Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-06-27T19:31:10.824991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-27T15:15:57.372858Z digest=sha256:a283144abe8803a637b7bf63ea0672274c7de04347c2a085a4c98a126f1beae2

Observation ae850d5d-f139-45b7-b894-84f5dc478d58 · inbound

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR cites this paper.

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T20:38:55.637534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-27T01:15:18.237335Z digest=sha256:cdb091593d97157afdc545977a7c511095d99e584c37506c3caacbce8c469bfd

Observation 4c48cefe-3cb8-4e0e-8d01-8ca8db22e6a3 · inbound

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation cites this paper.

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-06-30T08:34:26.739982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T08:30:37.016856Z digest=sha256:070d6240d43ac2ee1631d5818edc52b7bd3183ef52c7a7cb22d6fb8cc405a02b

Observation 47b71b74-eb5f-4be1-8c74-7423ae7750d8 · inbound

An Empirical Study of Security Calibration in Large Language Models for Code cites this paper.

An Empirical Study of Security Calibration in Large Language Models for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-07-01T10:45:43.070608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-07-01T05:04:41.223743Z digest=sha256:708fd435f1ad440425eb5a5d386be04e3b8959eb0040ef5d45d9afea499909bf

Observation 10b6b78b-dee3-45c4-ad93-253eab5c4f9d · inbound

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation cites this paper.

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T18:47:17.127993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-07-02T18:09:02.049387Z digest=sha256:b51cea744a35fd28ccd066ee1bb586b1809f73b5a830b707473c37098c46683d

Observation c30963ce-27fa-400e-a435-fb9881c66479 · inbound

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models cites this paper.

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-12T06:11:38.403281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T06:11:38.403281Z digest=sha256:96b3e1c0b8e21c6b632d9e367f59cfd141513fdf94c1b0a4a49b29960c1087d4

Observation f4053761-1f3a-4636-b63e-1601cd84c74c · inbound

A Workflow-Aware Serving Layer for Agentic Applications cites this paper.

A Workflow-Aware Serving Layer for Agentic Applications Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-12T05:56:18.797766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T05:56:18.797766Z digest=sha256:b55124366452015d4bf4403811dd86949b043ebc16cc23422ee7f71e3a73984a

Observation f66b06b5-0679-41c2-8d75-dc2f0fff2168 · inbound

Anchored Self-Play for Code Repair cites this paper.

Anchored Self-Play for Code Repair Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-12T01:53:44.674517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T01:53:44.674517Z digest=sha256:e87de7dc3a556730ba3b337c0aa1805fb629bb5fdfbaa15146656ac43fd3a2bd

Observation 74094312-599d-401f-bb68-9e6b3453759b · inbound

From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs cites this paper.

From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 101

Resolution
verified exact
local_arxiv, observed 2026-07-10T13:57:06.725523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-07-10T13:49:17.343893Z digest=sha256:de8870ae03d66691b4827b8c51451f50c8565add2eb62110163c3a47846616f8

Observation 5acf4e6d-2eaa-4133-858a-412334be0a1d · inbound

In-Place Tokenizer Expansion for Pre-trained LLMs cites this paper.

In-Place Tokenizer Expansion for Pre-trained LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T23:50:16.078214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T23:50:16.078214Z digest=sha256:85eb7b6d7d56503d3de3c80ee54750b1ab8f93b062c01d76c4f995ab886c0dff

Observation 352c5c68-993b-4673-8b6d-9112cf21ede2 · inbound

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding cites this paper.

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T20:12:53.304097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T20:12:53.304097Z digest=sha256:6c9dedaa564326d474c7eee6c54947d2574a996dc7e4bcdb7532aefcefda033d

Observation 72b1a9ee-8265-41f2-88a1-b21122b24e24 · inbound

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models cites this paper.

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-01T17:28:55.320455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:28:55.320455Z digest=sha256:4a35f1985f92fd4a81ec636d68d5f607c2692003d25cea69034e2559da8c8368

Observation 95e456d9-3bab-4274-9bd1-b4de3c8cf946 · inbound

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective cites this paper.

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T16:24:19.522774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T16:24:19.522774Z digest=sha256:27956b4b335803004e8405c7adfc7d1b1d7c28a90ec97e8579e85dfb7daaf3d3

Observation 3c17ac66-529a-446f-9b63-b65ecb06dc92 · inbound

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems cites this paper.

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T08:17:28.145819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T08:17:28.145819Z digest=sha256:277c5eaba616938c1e7a4f997049fc3bbd2dfefb1d835a67333ad9c10feb72f0

Observation d5732c5c-1f04-4850-ae29-5c652702d708 · inbound

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation cites this paper.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.929232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.929232Z digest=sha256:16918090ef5a0f21f61e8212f06aefd01c84e4a2e9a2004b0f1b52ed77eb2ca0

Observation 1cebe2c6-cf26-46bc-b2f4-b44bea188bbc · inbound

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies cites this paper.

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T04:39:20.562448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T04:39:20.562448Z digest=sha256:17b3660eaf6260d0bc505f963daa4a32776effd87498b6c5f61f7bd5bcc65165

Observation a0c3983b-7ae8-4e92-9d97-88c789f1249b · inbound

Route-Align-Verify for Functional Correctness in Code Generation cites this paper.

Route-Align-Verify for Functional Correctness in Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T20:43:44.662023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:43:44.662023Z digest=sha256:33b1902beae6d400716d238e0540c4d6a627c1810a62906ae0def300de681f38

Observation 273df496-7f4a-481c-8da3-dceaa36e01cd · inbound

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies cites this paper.

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T11:39:30.938716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:39:30.938716Z digest=sha256:fe2f4be1fc711b4d25a94f037ebe866015beaa4faa8bea6ee1692d46337f9902

Observation 87651470-86cc-41a3-8229-f6353539872a · inbound

When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition cites this paper.

When Do Task Vectors Interfere? Mapping the Validity Boundaries of Weight-Space Composition Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T16:35:24.740380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T16:35:24.740380Z digest=sha256:099b729889a9b381642af28114f913bff4e7e6e4d14c2cd2c8fbfa2dedfc51cd

Observation 0e08ed39-0c87-412e-9dba-2d8a1f67fe99 · inbound

REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation cites this paper.

REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T00:35:19.162472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:35:19.162472Z digest=sha256:e468269cb5ae235329430de7c75f4e2616b42ba09870eacb0566a5d622131dc4

Observation b582c7e7-387c-4ec0-90dc-fbd34e2a40f8 · inbound

Latent On-Policy Self-Distillation cites this paper.

Latent On-Policy Self-Distillation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T18:07:21.547240Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:07:21.547240Z digest=sha256:1e37db3dd8453e75f5a8a7071ae20f25d9e46ee18a3c354f9ca2dea468ed7a16