Pith. sign in

Paper Citation Record · LEDGER

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

As of 5 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 53 inbound Pith citation observations for arXiv:2305.01210.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2305.01210 v3

Coverage vector

measured 76 of 76 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-14T02:04:17.888553Z

measured 129 of 129 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 53 of 53 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T20:43:44.662023Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

76 of 76 outbound references displayed

  • verified exact14
  • verified fuzzy31
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

173
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation f73be170-7431-4faa-88aa-b52f8eecb123 · outbound

This paper cites Ahmed and P.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Ahmed and P

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.249862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9e9db788e056d2fc47a476dae9d67ba8607349fb7001df099c4c5c8361509c07

Observation 949efa0e-16cf-4f29-b64c-dedd88bdc79c · outbound

This paper cites SantaCoder: don't reach for the stars!.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation SantaCoder: don't reach for the stars!

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.938020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:389daefed0b199cf963a4735f6ae3bd8a211dfddcb5bdac8e86038a7120a52d1

Observation 70d2ca6d-ab75-4ac0-9be2-d1ce9c2416c6 · outbound

This paper cites Austin, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Austin, A

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.286404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:47bb1e2d09774f9973cb72d6cf27e41810bfcb58b17791ba27108416c00ef961

Observation fac0f6ae-5cee-4951-8239-75706a60ae9e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.289530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:2b146939bde6ed09e839159dc56283f4dc156f50a2f58e256d49ad7c48ae3f85

Observation 0688b73b-8ed6-4c6e-81fd-5e830ebde207 · outbound

This paper cites Black, L.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Black, L

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.293002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:abc89604e3aea5913188a3189ff30608ed0d848862f7fcc87b88faa436a28fe5

Observation 7f8acf35-d4fc-4f5e-9279-5d44ed6256c9 · outbound

This paper cites Brown, B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Brown, B

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.300747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:f705ff1e81ed1154a9aa9a41a9fa2b6bb661f79186ee20ea7103dac75215e534

Observation 411e5b4e-02c1-4a32-b650-e4c0d593166c · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.304288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ff1a08cb02b01aa943a8e1635960e9fdf4183d93538b7dca0ab542c07e37fce2

Observation 43dbb854-6b83-4772-8695-6313582d45d7 · outbound

This paper cites Cadar, D.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Cadar, D

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.307765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:74cad346c6820831b80edd66a99273e03b65fff90152bf23742d6075598366b1

Observation ea0550b9-7865-43a5-a0ee-027f55684d79 · outbound

This paper cites Cassano, J.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Cassano, J

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.311374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:692f02d54618b62e33ef8c9938b356a152fffae60e5fd94a9860694cf89299b5

Observation 01893e90-e026-4c1f-b113-5d141122aa4e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.314674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:97375c24293984684cacc20571dde9ab96edc7f0745ae8f0be22c46530866e6d

Observation 5f0de9db-4d67-41a8-ad68-edb9b52b77f3 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Evaluating Large Language Models Trained on Code

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:17.959701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:67475b6e8bb657c5728eed1d6ebbeba0e162672aff38164052778b4be627f1a8

Observation 36f78d3c-1be9-46c8-a7f6-4e08ba570ced · outbound

This paper cites Chiang, Z.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Chiang, Z

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.327981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6c56640a2e7f1289b67c94875b24b3807000c5b38734589385beda08e3b8497d

Observation c5c7688c-859a-4e68-bd0f-83cb82f2e8f8 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.331053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:302943eb1f42625cc4d77062e913ea200f87df3faf37e4e71e770df7c5fe32a4

Observation 6bdc79ea-ee1a-4ff4-a742-b67b9cc0f4ae · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.335212Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8593e77e6869a89ab0909f5ae3424b8593777ebba235c729be50ad85b6fc5242

Observation 66279dc6-8d9f-4679-bc48-798242d23d7f · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.339909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:92eed8151a8d4e4f13e34cceed631ed2789d438b58041bb940e278b595e8adb5

Observation 4b45ab5c-057b-4993-a08d-37c75e5acccc · outbound

This paper cites Fauxpilot: an open-source alternative to github copilot server.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Fauxpilot: an open-source alternative to github copilot server

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.345772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:5a7f7bcdd4a73f8d1f21f5f16a03ca8d68219ac9d78d8cbbb64c64ccdd5e2fa1

Observation 29418d9f-fc37-4661-aef5-bccfcfe1939a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.035645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:afaf8722a91ce1a2cc5ee192c998894c26b88cd863999b248275636390eee090

Observation 8968cd5d-a183-49fc-b36d-d7db459f9be1 · outbound

This paper cites Fried, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Fried, A

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.041895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6fd1b0ee32aadd2c667c4f6f764a76b0623343bd45bd865d9bf43fe80a78068d

Observation 17cd2fbb-21c7-4c07-9348-11938d4ad6a0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.047446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:361ef7bfab936cad4332a1d8e6d87253a9a07cee63ba15649ca4d97493045aeb

Observation 2079d139-fe79-4d00-a935-0d345e139e9e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.053673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:dfbafb6807181cf2626cb83340eecb96004e42df7a7b4c5425abd6ffb8ecb55c

Observation 8bf1ae76-8faf-42f3-93c1-65f71d1bbdc3 · outbound

This paper cites Gulwani, O.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Gulwani, O

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.063338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:0c426eb203917aea7c0f3d30c9c2cab59ef09b39c8efdbbb4ed9f7f0e69924dc

Observation f77f2e7b-9911-4a06-a377-9c55202ed60a · outbound

This paper cites Hastie, R.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Hastie, R

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.070028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:02fe3f02077378091f0c24fc4793a792c76d804367396e27305c9412a35c8b78

Observation 34ce07cf-2573-4151-be96-42a863889e1e · outbound

This paper cites Holler, K.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Holler, K

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.074605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d00dbd9615dfa3cfac7a937d2552122b6de191efd6cf56da259702b574eef5db

Observation a300eaed-3f09-4678-b30b-65804bf3c580 · outbound

This paper cites Ivankovi´c, G.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Ivankovi´c, G

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.079390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:e4e135716c3aed375336f15f4297f39e5d3430d3eb93c537604fedf1f868ca1a

Observation 374ce154-fb10-42bb-b507-37bce2261277 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.085043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:b2563724add10fb5011961a04ecb9a1841af752fee73c0226bf1f91b8c01ee4b

Observation 4aa24f72-6b1a-445c-b36c-9ce893a23b34 · outbound

This paper cites Mistral 7B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Mistral 7B

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.001948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8b0bc7871f14a0af2bdb701b8842918cddec2ed11ccd03f593838f4d28fd9818

Observation 52af1a6e-2121-430d-a47c-0b8f3c53b5c5 · outbound

This paper cites Impact of Code Language Models on Automated Program Repair.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Impact of Code Language Models on Automated Program Repair

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.014273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:4a6125cea50317777f5a92394b5488ac713c59a9c47a000a69f0fc34566ee9a0

Observation 7fa4371e-4c3f-46e5-a8dc-7876d2ecd440 · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.022396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:132c4e7e6d3c14d22b410296d0c5b02fb2c9f2dbbef5f3dd7915ec403138c2cd

Observation d50fb4ef-afc7-441a-b004-ef92a7df5e61 · outbound

This paper cites Kalyan, A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Kalyan, A

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.090978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1c9cc727caa3b25f581d4af10f52362fc9a6130b6df9267014b1bbf946dc7797

Observation a3138b82-c67c-4e3a-8cf7-da1edda36ac4 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.098983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1106847009ed53e7a74a07f849e56897a3e02a08bee6ff7111793092a5dcebe9

Observation 4d310cd3-2c37-4d00-ad59-73124943232f · outbound

This paper cites Unsupervised Translation of Programming Languages.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unsupervised Translation of Programming Languages

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.993427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:462f8ea80f01c9bc78416ff5394cf5f1e79c5015be75bf1c1c36bc22ed6dc084

Observation f2eb8f01-4c65-49f9-8673-f388a46ee0a1 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.103730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:3abb6256e58ad20f78f19f62780fa31e8233169771c0a9e776f112cdbdee024b

Observation abdb1ea0-c616-46ad-9db3-5c4ca40bf96e · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.111346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ac394dfbf94d3ae148bfc4856204870aa15dd0a8c202a1be1549838b5c6daa40

Observation b63a7451-52dc-41e6-83b4-9eb99978cbc0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.119161Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1e02699a40fdf2538a7833c7a76ef6dae3f0d9dcb68318f192251a2adb1dce76

Observation fa1da41f-c754-45e3-b78e-19fa62da4acd · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.122573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:fc40ed01347d66618c7f0ad34f9b838a62d9b4eb9f19362a371e4cdac4d444cb

Observation 533ad619-2372-445d-9a43-8a88f4d15829 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.126476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:af746f27ecd07a1c020a297e292dfd44efa0c219a344211e082477d2f522d71f

Observation 7a53ef94-3f67-47df-92ed-c82981612337 · outbound

This paper cites CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-15T11:40:02.914862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:fe2a3271aafbcf055e0f84042c0fdae77e6b7c106ae6479973a9d1ab62136e32

Observation ead87ab5-6cef-4d53-b7bf-5df8003dabef · outbound

This paper cites WizardCoder: Empowering Code Large Language Models with Evol-Instruct.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation WizardCoder: Empowering Code Large Language Models with Evol-Instruct

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.985483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:79fa1ab982e5db5a2404ea25e455f9d14583b68dc8200b965adac87b345b060e

Observation a455a752-73ee-4ac4-9d80-ce0a39234467 · outbound

This paper cites Manna and R.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Manna and R

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.133825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c1c573c36cfa83b0e2572c9a502b714fa5c0592493dc3f48bc0428dedf129a74

Observation 76fba8f1-d798-4456-b4db-f133d7123aae · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.137223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:69d1326bcf65b5ffc7bb1fd49a2ffb8d3a4815efad36ee8887a2cbb3d3f31188

Observation e80156be-262b-4f1b-a0d4-07973268d354 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.140516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c7d4b1d1b6fc70a254e62e6dd8f7fac90df82c957d8e2824ef6d3794af942738

Observation 8ead5d23-3592-446d-b850-e9da13ab7789 · outbound

This paper cites GitHub Copilot – Your AI pair programmer.https://github.com/features/ copilot.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation GitHub Copilot – Your AI pair programmer.https://github.com/features/ copilot

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.148026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1d372bc01c519edcf8b3ca82a268f48adaf5a9749a2a0ac3014aa708429c1a7d

Observation aedbf686-24cf-4ad2-8502-7294825cabc7 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.152202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6f0a2cfc74626a14878a3457a2ab6b4fbaacd4ee08e19bb85c69f2445c78be25

Observation ef70036b-a4bf-4258-b343-424e609f5e13 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.156502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:465bdb219d35a2e60eac7946673f4ddb13fac614d67422cea118ab2f86c7a3e4

Observation 8f23dfe8-7248-4f46-b55e-a2a9997199b8 · outbound

This paper cites Nijkamp, H.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Nijkamp, H

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.160859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:6c682d701962c0dfe9fbfadc016dbcf9eddbe82e5d70f8d7e44ff360f073825c

Observation 4a8e6c2e-4908-4822-81ac-cf845dfebda4 · outbound

This paper cites Nijkamp, B.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Nijkamp, B

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.165155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d3f6adf25b1e546c453456da403818277f4388dee94caef11929d20151c8b96c

Observation 67422d45-fd7e-47af-a57b-adc9fa271af0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.169828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:879bd734ebba3675eee3d791f552b58a46745a83a150b753832ec75e1bd2c75b

Observation e05f6857-6be3-4c99-aced-2f4ff5990bba · outbound

This paper cites Chatgpt: Optimizing language models for dialogue.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Chatgpt: Optimizing language models for dialogue

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.177498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:61203fa6a2a6e3ff5a38cdd6ced11f4da7dac5d9b1ff1b715282b079e0f07b5f

Observation 58ebfbde-dbc7-4b54-a72b-44d0d3b610a5 · outbound

This paper cites GPT-4 Technical Report.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation GPT-4 Technical Report

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:18.008192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:ca961cb585dcd0f40be7e5290feb97e7123f56100ed6dc374ae12bd8196ad815

Observation 040cdad9-9fc2-422a-9fd0-fd3612114024 · outbound

This paper cites Papineni, S.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Papineni, S

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.185652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:905a30fa9ae25afa5dede07063d1241fe4b1e024cf57dcb24fcd1a020df34686

Observation ad4371e0-fe75-4b4e-9e25-bf9fcc182a95 · outbound

This paper cites Petrovi´c and M.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Petrovi´c and M

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.195769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:87980e09d2d4dc0983fa05b9c35de51761d7363bc77eefb7b34dfdcd41aac1aa

Observation 54038b96-f9c8-4450-8fff-fd9f12c5d017 · outbound

This paper cites Phind/phind-codellama-34b-v2 · hugging face.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Phind/phind-codellama-34b-v2 · hugging face

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.201717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d2c5c023c5ee577e73afe8bc638d04073927b5e7b29254c382f7f5db05da1a69

Observation 1d12a269-ae13-4c0c-ad3c-04cbe961407a · outbound

This paper cites Rothermel, M.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Rothermel, M

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.205944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:0ae4090a06d80e9023d7c211e47dd11138ee55b7e5572857d4c2438ab3f17ef9

Observation 1387f375-fb63-43f5-8064-f47684925b52 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Code Llama: Open Foundation Models for Code

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-14T02:04:17.969215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:40770cf4f781ebc9b92663967552810deaa42504883793bc2cf5d76e06ce5536

Observation 5a2bcf3d-6b40-411b-8ea3-814661c43b0c · outbound

This paper cites Leveraging Automated Unit Tests for Unsupervised Code Translation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Leveraging Automated Unit Tests for Unsupervised Code Translation

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.974075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:e0cc1d35e64fbba15d6a4e2eced32263bc4bdaff76f87a83bb459cab88e432c7

Observation f5d5f0c2-5bd9-4b0d-8fd5-d3ff6942ddd0 · outbound

This paper cites Security.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Security

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.210368Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:c2184b06159ad6190591c5ae0ae7fe17628d5feffd3f7afd6e9378fdc008322a

Observation b62d1faa-3079-47d2-8881-6702e46e8d30 · outbound

This paper cites Serebryany.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Serebryany

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.215961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:d4fb2dd7e096d633834930896835aebacc438847a33576e8c18d6c4eb76f4515

Observation 0cff1382-c898-490f-95a9-fff5ccdc35bd · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.220422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9737519d07ef957ac870558f034afc2917cd5400830ec0ec284bad926cd767c2

Observation 817e2ba6-0bba-4ea7-9805-21c1afc5832c · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.224667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:850a62f9af3764c407999aa79c48e52e920f032c3e95fec18b76db795a342583

Observation 5490c333-f08a-47f3-9cca-26a3264b47b5 · outbound

This paper cites Stablelm: Stability ai language models.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Stablelm: Stability ai language models

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.229138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:1509e9cc19b39bf8513e1eda4cd6bd2eae8eaab35ea2ee5dd080b34ba315f8ed

Observation 63630815-ccf0-4f45-9534-cc7b27b0265c · outbound

This paper cites Vaswani, N.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Vaswani, N

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.233368Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:3e91f9d26d4f430f96cdf2097ca2b1be860e7b932b16d6bdd3df5c55573b314f

Observation c1ebfdb5-bd0e-4dcf-af14-1cb47f90cca0 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.237637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:5fcf6623733d996304624e44f8bbc44d60c636445a94abf5615c62d8dd1c77a1

Observation f37ade9c-ef78-4a70-aa7b-e39b36609806 · outbound

This paper cites Wang and A.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Wang and A

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.242502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:008ba18c10fa9bd2dc301f5c7be2ed621930241771cdd34ab314ba8ea3340d24

Observation c70a20bf-4ed4-4542-bb05-5808f9ce5db1 · outbound

This paper cites CodeT5+: Open Code Large Language Models for Code Understanding and Generation.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeT5+: Open Code Large Language Models for Code Understanding and Generation

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-19T05:26:57.653334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:14563f012c27159750cdee10f07d5af01d7d7c32050fd20e13dfc915e800aa21

Observation 9a793f47-af67-4557-a227-e3b203b221aa · outbound

This paper cites Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:17.952242Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:bb57b9c754e8ac2998b3b5016b93c2bad1a9becf3d9bc181b3a00cc8494dbad1

Observation 784f48b6-3d7b-4b9a-b472-0205e3d903ec · outbound

This paper cites Winterer, C.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Winterer, C

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.246481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:8a87f41db84edc340a32fbe4db2ceb79508988b9b4d54a627e132fba96deebb0

Observation 6a6e265a-f2af-44c1-aed0-82c85a5278ee · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.283210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:9aa0faf8a122e8dd52b599d16df08ecb59b6cfabea4632a18fc61baeb4cf4a14

Observation 27e9f268-6416-4047-bc48-15e164fd257a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.252923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:452be0be8ced6d32d3b8ea31ed7112bd734ac2dae943e5770ed77143c17a0db7

Observation ea49175e-f8a9-46ab-8c8b-1023615d799a · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 69

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.258639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:3624b2e1c2426b2fb69a8d871cfe4f973fbea6c31f261688c659ce64dbbee0de

Observation 4bf61302-0235-4e49-8dcb-f6d2012d1ee9 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.262350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:a8f73b5b77520820feb358590acf8862a71150494e530de0f923ab8964880f98

Observation 50822c0d-70fe-4389-bb61-6356562a4a54 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.265396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:03d6d55767709e178c4637998c7f5835a9fe9c154566086055ac1549dd5289f1

Observation 6ee73def-f8a7-4677-94b6-bebeee093b52 · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 72

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.268788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:bea92fd8d068da652718f637133288070f1734623e0a514dc0688dd4b569caaf

Observation be4a29fd-3edd-442e-bc5a-dbe64d19da9d · outbound

This paper cites an unresolved cited work.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Unresolved cited work

Reference 73

Resolution
unresolved
raw_fallback, observed 2026-05-14T02:04:18.272073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:88490727ccf5197187af57f40a857d12a9911cd96d4df70002ab11cdfedf0b54

Observation 79cac963-d3db-4feb-bd5f-bf1526b40968 · outbound

This paper cites Zalewski.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Zalewski

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.275719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:eadf84e2e68b581a3a1d817bb714a7bb08d06de938e6b05b4d7c1317211234b1

Observation a0df4eec-d2b2-43a5-baec-d2e5856d21a6 · outbound

This paper cites Zhang, D.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation Zhang, D

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-05-14T02:04:18.279191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:de0a6156a70e71425ab0758904251250886f984022fa3dc8dbcf82b4247cdbcb

Observation d065e01f-19e0-4044-a0f1-5b1be68a83b1 · outbound

This paper cites CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X.

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.031433Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T02:04:17.888553Z digest=sha256:b7f38a4a5def95b99a1eda95c770aace272bf99fc353b923985ef5f03f894b0c

Pith citing papers

Observation 40aaa769-da10-494f-a81a-6b6d410f0289 · inbound

CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society cites this paper.

CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 69

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T01:40:53.351795Z digest=sha256:76faf889b1eb0888fddbd24f7c806f9579c3b4800771e244b6955045163bf93c

Observation 48975998-ef2f-4736-aa69-c3289948a757 · inbound

StarCoder: may the source be with you! cites this paper.

StarCoder: may the source be with you! Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 289

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T23:32:59.517389Z digest=sha256:a7a1712cd26a4c197a4c5c3a89f52df13356cfae6b76ddafeefb232c26c7f908

Observation c1862457-8bd6-468d-9b75-9c5425455271 · inbound

Textbooks Are All You Need cites this paper.

Textbooks Are All You Need Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T04:44:03.148223Z digest=sha256:5e8034700408f03b8579bb65c3608418a55b67c46f40e7c140ba1ec0bf7348b3

Observation eb0386ec-8d79-42f0-ac77-d3e6558a12d4 · inbound

A Survey of Hallucination in Large Foundation Models cites this paper.

A Survey of Hallucination in Large Foundation Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 81

Resolution
metadata mismatch
local_arxiv, observed 2026-05-16T15:21:00.858962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-16T15:21:00.778049Z digest=sha256:71055bda94974c7ab5941f2528e9a0d914fa38b6d1a1e89761f2142d2d37b3ee

Observation 9d2f60b4-ba28-4982-946b-1f55c3023fda · inbound

SWE-bench: Can Language Models Resolve Real-World GitHub Issues? cites this paper.

SWE-bench: Can Language Models Resolve Real-World GitHub Issues? Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 113

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T14:02:01.201111Z digest=sha256:21d10a21ada55d5bb9094034e68d53c420f2d18a95334bad39f0577a51e81bbb

Observation 5a6e1e36-c4e9-4760-a5ae-00f9de4c00e7 · inbound

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code cites this paper.

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 277

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T17:34:42.565806Z digest=sha256:ac795e5fb4be8116cc07d96bf6c3084752304143a22a9060718de7565d0677c0

Observation 11e163e2-c1d4-4f87-ab0b-4667e551c619 · inbound

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering cites this paper.

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-11T12:45:34.286368Z digest=sha256:92dbe54696b45ea1217622b6d19726e4806a647abb19d01b3ae87b6dfbe34e35

Observation fd5de2bb-c7be-4f87-bf34-5a3b69153488 · inbound

Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs cites this paper.

Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-11T22:22:27.455361Z digest=sha256:d6e3b27f72ef0f0fea72dd1fe6989c7304dbb2078e89d01a978a229d77c0ef54

Observation 6282e203-731d-4d3b-b0d2-f2945b65393e · inbound

Mercury: Ultra-Fast Language Models Based on Diffusion cites this paper.

Mercury: Ultra-Fast Language Models Based on Diffusion Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-05-17T02:05:18.905965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-17T02:05:18.834924Z digest=sha256:9842e7422dce99eca5997008661aed2abc5bb9ef953c12bff91a9d628b83140f

Observation 2b7f693b-3821-4027-8715-437ead5f5ccc · inbound

NVIDIA Nemotron 3: Efficient and Open Intelligence cites this paper.

NVIDIA Nemotron 3: Efficient and Open Intelligence Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 104

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T01:40:42.541794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-18T01:40:42.190369Z digest=sha256:357f71a8063354a2941f1614593c9a6f348723f6a4c382d1670c52cd850d7153

Observation 1084df84-7ec8-49a2-9561-8a9106c465bd · inbound

Ensemble-Based Uncertainty Estimation for Code Correctness Estimation cites this paper.

Ensemble-Based Uncertainty Estimation for Code Correctness Estimation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-14T22:53:14.056575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T22:52:58.524934Z digest=sha256:21c13fecd90a8cbfa502d99dbadd2a802a10f60e392c4762fffdf6327a9b2790

Observation 3b19f78c-15fc-4996-8f17-100d027cf72e · inbound

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping cites this paper.

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T16:35:33.392202Z digest=sha256:fbfe7c51dd30c8da8a85124296750c31cd983d620ce401cee85a1b750193f58d

Observation 218a1ff0-f3c8-40de-a319-a1d625c43278 · inbound

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation cites this paper.

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T15:44:50.762366Z digest=sha256:aec9555e39f194f21ab15bcc59624b9e65921da48e6538e44524d6864301265c

Observation a41a87fa-1cce-4152-b285-44bacb6a7aed · inbound

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation cites this paper.

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T00:19:57.865123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:19:57.865123Z digest=sha256:033c5680e6f3b7c459653d4cec79cf95a3fe43bca2cca3c2d457dec8f30e08f0

Observation a343b8f7-60d1-4bcd-bb72-1bbee37aa1fe · inbound

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review cites this paper.

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-15T19:56:33.755930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T19:52:49.324500Z digest=sha256:18fe3239ac3047258742fe1fca4f40d470152242341f4f39195b210431e92b87

Observation 5cb5290e-be05-415e-b994-b43b142f8936 · inbound

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts cites this paper.

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T05:52:28.822723Z digest=sha256:2f09b97d5e25a59c7f26c88d77b355ccee46535c095d6b551e39ad9a9c0d4301

Observation 3f084246-e86a-43b0-ab80-84f920b33324 · inbound

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation cites this paper.

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T04:21:39.637962Z digest=sha256:7c3cf2d88190f86b39e5a9f189652e4b4a89429d554ff44dfd59b2903a9e90ea

Observation 8d6e07d3-3929-444d-82fe-9ce2d533683b · inbound

You Don't Need Public Tests to Generate Correct Code cites this paper.

You Don't Need Public Tests to Generate Correct Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-09T20:57:43.802195Z digest=sha256:fb010989a86a30fd03814320f8bd656138dc483c2ac8c4dbc16ad45e3b143bdd

Observation 5b0dd6e1-4b21-4614-ae54-72b8f8930637 · inbound

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis cites this paper.

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T03:07:06.924437Z digest=sha256:5bca809d6a6b76d83ef9abff6fc319ae7a90d446f1f637169a8775aeb0d80616

Observation d8d67c4e-06f9-43ed-b96a-70a287891fd9 · inbound

When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation cites this paper.

When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T03:00:26.137401Z digest=sha256:085d71b3ed7c903c1655e061216119db8b879dd522a9b9b0bf4ad450ee2dadc8

Observation 4ec36916-308f-4f35-8a14-a51ea3e590a6 · inbound

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation cites this paper.

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T10:33:28.276228Z digest=sha256:af79a8a16162a2a3c7172c9bd9e2648f8105cb278246ce3763d8b469afac7602

Observation 32612799-a066-49b0-b250-2d8d92b0940e · inbound

ProgramBench: Can Language Models Rebuild Programs From Scratch? cites this paper.

ProgramBench: Can Language Models Rebuild Programs From Scratch? Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-07T16:02:16.598404Z digest=sha256:1e57a03cf98a3a7a962f82406698ba1a71f559d60fb7061396f2e10e3e5b1fa3

Observation e9240e43-6025-4883-aef6-1fe98f3715d6 · inbound

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code cites this paper.

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 71

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T17:37:51.790000Z digest=sha256:fff5adbd46b3dd9066d71cd03de94a54a9790f0e3cc886297f1fdaaca9d2c9ea

Observation 4423ff8d-f199-4bb1-bfff-6be961c09317 · inbound

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training cites this paper.

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-12T03:34:10.370956Z digest=sha256:197ee1ca0586ffdc054c50eab4cdcff1643a1cc527057762d9078220c8eeabd5

Observation d9bcabbb-4713-4817-b8ce-183363f209e4 · inbound

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training cites this paper.

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-05-20T23:23:51.285678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-20T23:22:51.808346Z digest=sha256:74b728774a234601161cc2897959cf863395915823e38c0ad742319913d627d3

Observation 760705ac-573d-4fe2-baa0-39f883d84a80 · inbound

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation cites this paper.

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T02:07:49.789835Z digest=sha256:c4ebd0eacf1c7e31026d22663f7a76a9ad86c302a6a25c2e7d22928275232d31

Observation 8aefd51a-7419-46f4-8b6e-86b02e2f5293 · inbound

Evaluating LLM-Generated Code: A Benchmark and Developer Study cites this paper.

Evaluating LLM-Generated Code: A Benchmark and Developer Study Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T02:27:11.573347Z digest=sha256:bfd45bc48a9db85840d8da9dabec20332842885a60f452581e5913a491274f67

Observation cacf0642-5b7b-4c18-9d8d-cc6fc6eec3a1 · inbound

Evaluating LLM-Generated Code: A Benchmark and Developer Study cites this paper.

Evaluating LLM-Generated Code: A Benchmark and Developer Study Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-01T13:35:46.788186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T22:55:49.377456Z digest=sha256:2517646b427ef2483afbe4a7553be0492d733e655bbbac011ef5d4d05875fa96

Observation 3cdb55f6-0bde-4d7e-b438-2ebdf4116c63 · inbound

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation cites this paper.

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-14T02:04:18.346890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T03:12:49.428954Z digest=sha256:68c930f7bad66d76ec0dbc64e5170805b64b908b40d26ba3602d5bc0625b2332

Observation f62d2ac0-7294-439d-9d67-3408ef4d6fcc · inbound

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation cites this paper.

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T10:11:22.819039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T10:10:14.565995Z digest=sha256:f2efc290e77ceb7f65bd8cae0a24b2e06263560bea5f3e285499b215777763de

Observation e5b40be9-fd56-473e-914c-dc4bdcfcb9ff · inbound

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution cites this paper.

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-05-19T16:32:39.498041Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T16:28:23.113976Z digest=sha256:22d0aa5b504d4ad93525d945b8304205d73a771a4d7f625ee05876c1ed4aaaa7

Observation bcc93a67-bab7-4d9f-8068-85a5a2621b86 · inbound

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning cites this paper.

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-20T13:18:18.484837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-20T13:13:51.081597Z digest=sha256:c13cd2c59da7a45f629d97b38a04a99512b1a2a5d24148a2b3a774d3f749ef87

Observation c7bf2feb-010f-4fb2-927d-d630c7e32d9c · inbound

Hide to Guide: Learning via Semantic Masking cites this paper.

Hide to Guide: Learning via Semantic Masking Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-06-30T12:24:40.021889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T12:16:12.108715Z digest=sha256:ba33634a695dcfaf2ebd3723064e9d2e276d913b75ef3a885dc92dba1a70dd10

Observation 17f86524-7e07-495f-b44c-ccf06ace390b · inbound

Efficient Benchmarking Is Just Feature Selection and Multiple Regression cites this paper.

Efficient Benchmarking Is Just Feature Selection and Multiple Regression Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-06-30T00:24:05.147871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T20:20:15.314971Z digest=sha256:b0817e213222202c2d6ce7194c0dfdb0f444c266a2a1b4a0e1f634c1e27ac4d1

Observation 25a591e1-839c-457b-8a2c-5f4f3c417a3f · inbound

Mellum2 Technical Report cites this paper.

Mellum2 Technical Report Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-06-28T23:02:46.558336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T22:58:35.397914Z digest=sha256:e567b4dd190b2a9a014d3ce0d2613869707bd969617396af8a9e8aa76fe175a0

Observation fc6dd5e8-dcb0-4ed7-9f18-1d229776522b · inbound

Before the Model Learns the Bug:Fuzzing RLVR Verifiers cites this paper.

Before the Model Learns the Bug:Fuzzing RLVR Verifiers Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-01T20:46:13.789220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-28T17:45:28.461939Z digest=sha256:9d871ea7fc8ae54727ff0d6741ef24ddb1dcb8432f3540bd5c41f4cd955207b2

Observation c04cad1e-f21f-4203-b121-d643ecf823ce · inbound

What makes a harness a harness: necessary and sufficient conditions for an agent harness cites this paper.

What makes a harness a harness: necessary and sufficient conditions for an agent harness Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-06-27T19:31:10.824991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-27T15:15:57.372858Z digest=sha256:05e62b4d35f8c099ca3ad2a289b4e05ac7c617ea22f4718b29bc9f597f97f344

Observation ae850d5d-f139-45b7-b894-84f5dc478d58 · inbound

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR cites this paper.

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T20:38:55.637534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-27T01:15:18.237335Z digest=sha256:4da58adf27e7cd2a9a744f7f7258fab8622a35a36404c0ecff9047226397774d

Observation 4c48cefe-3cb8-4e0e-8d01-8ca8db22e6a3 · inbound

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation cites this paper.

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-06-30T08:34:26.739982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T08:30:37.016856Z digest=sha256:8deb41fae3732d04ea274b7439adba3027da5e4ac52740e42287ca7c0f611424

Observation 47b71b74-eb5f-4be1-8c74-7423ae7750d8 · inbound

An Empirical Study of Security Calibration in Large Language Models for Code cites this paper.

An Empirical Study of Security Calibration in Large Language Models for Code Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-07-01T10:45:43.070608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T05:04:41.223743Z digest=sha256:86477fbeb0d5743f0d88b94b113a74143c281950bd887c117ae9bd8781b89ea7

Observation 10b6b78b-dee3-45c4-ad93-253eab5c4f9d · inbound

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation cites this paper.

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T18:47:17.127993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-02T18:09:02.049387Z digest=sha256:060e8a66ecf4b74054eb6bcd25cf554e90a00f0cf3f418b11e88816032e962cd

Observation c30963ce-27fa-400e-a435-fb9881c66479 · inbound

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models cites this paper.

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-12T06:11:38.403281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T06:11:38.403281Z digest=sha256:952e71051d408dfc89da0b19e93d69383d5811c4dd8832c85dbd0af0f8022c7f

Observation f4053761-1f3a-4636-b63e-1601cd84c74c · inbound

A Workflow-Aware Serving Layer for Agentic Applications cites this paper.

A Workflow-Aware Serving Layer for Agentic Applications Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-12T05:56:18.797766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T05:56:18.797766Z digest=sha256:7c51090a01e07f0cefc692984ed6f78e08f4003aac82c664070b00f12f2164dc

Observation f66b06b5-0679-41c2-8d75-dc2f0fff2168 · inbound

Anchored Self-Play for Code Repair cites this paper.

Anchored Self-Play for Code Repair Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-12T01:53:44.674517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T01:53:44.674517Z digest=sha256:d8fce278cc9c0fa079d4e2ff4112b677997e341bec3ed652ff6cce0ccb9f5763

Observation 74094312-599d-401f-bb68-9e6b3453759b · inbound

From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs cites this paper.

From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 101

Resolution
verified exact
local_arxiv, observed 2026-07-10T13:57:06.725523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-07-10T13:49:17.343893Z digest=sha256:b243c441a38b998bb0211853b732e4ebbcff9360ef332d16b31100d0dc738fd2

Observation 5acf4e6d-2eaa-4133-858a-412334be0a1d · inbound

In-Place Tokenizer Expansion for Pre-trained LLMs cites this paper.

In-Place Tokenizer Expansion for Pre-trained LLMs Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T23:50:16.078214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T23:50:16.078214Z digest=sha256:a6c768eb23972924bb11827120eb5c356aab3e1c396f9cfcbb983edd23478598

Observation 352c5c68-993b-4673-8b6d-9112cf21ede2 · inbound

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding cites this paper.

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T20:12:53.304097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T20:12:53.304097Z digest=sha256:bca7554a8d8891cd0572684299e1404f6ed27863f2caa759657f9bbc104c80e5

Observation 72b1a9ee-8265-41f2-88a1-b21122b24e24 · inbound

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models cites this paper.

FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-01T17:28:55.320455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:28:55.320455Z digest=sha256:69ed80d870875b14ff28b2d3244906dea5d3fb9eef079d48d0e10aa3b5c5d62a

Observation 95e456d9-3bab-4274-9bd1-b4de3c8cf946 · inbound

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective cites this paper.

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T16:24:19.522774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T16:24:19.522774Z digest=sha256:e2019d5f9cbfdd20bf3324ef50ed7ae57022d398011720f987394b88b0f85508

Observation 3c17ac66-529a-446f-9b63-b65ecb06dc92 · inbound

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems cites this paper.

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T08:17:28.145819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T08:17:28.145819Z digest=sha256:4526cb5eece91ba899c7b7f14fa09de2ffa5549f1f522ad163902adac2f4709e

Observation d5732c5c-1f04-4850-ae29-5c652702d708 · inbound

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation cites this paper.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.929232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.929232Z digest=sha256:425db579c1570d915bfcd87fb740efc92d0e4c0170f5a7e7bd451bfa93e2b192

Observation 1cebe2c6-cf26-46bc-b2f4-b44bea188bbc · inbound

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies cites this paper.

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T04:39:20.562448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T04:39:20.562448Z digest=sha256:a6cdb4225c8750acdea72f5a6876e554d7cdd1f9c57ad66d6a7903c65bffc442

Observation a0c3983b-7ae8-4e92-9d97-88c789f1249b · inbound

Route-Align-Verify for Functional Correctness in Code Generation cites this paper.

Route-Align-Verify for Functional Correctness in Code Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T20:43:44.662023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:43:44.662023Z digest=sha256:4cc9a1179add25e8a54acfef7d41e55191f7d7411ab698cefed281ba7312c40f